Opus 5 дешевле за задачу, чем 4.8: пора ли обновлять агентский пайплайн
Opus 5 стоит столько же за токен, сколько Opus 4.8 - 5 долларов за миллион входных токенов и 25 за миллион выходных, - но решает ту же задачу за меньше токенов и шагов, поэтому за выполненную задачу выходит дешевле. Обновлять агентский пайплайн стоит, но поэтапно: id модели меняется на claude-opus-5, а парсеры ответов лучше перепроверить из-за усиленной самопроверки.
Opus 5 - новая клод нейросеть от Anthropic. Токен стоит как у Opus 4.8 ($5/$25 за млн), но задачу решает за меньше шагов, значит дешевле за задачу. Разбираю на пайплайне, пора ли обновляться.

24 июля вышла новая клод нейросеть - Opus 5. Первое, что я полез проверять, - не подорожал ли токен. У меня на Claude пашет целый агентский пайплайн: он сам собирает темы, пишет черновики статей в этот блог и потом сам же их проверяет по скоркарте. Каждая лишняя копейка за токен множится на сотни вызовов. Хорошая новость: цена ровно та же, что у Opus 4.8. А задачу Opus 5 при этом закрывает дешевле. Ниже разберу, почему так выходит и пора ли из-за этого лезть обновлять прод.
Сразу оговорюсь: сам я на новой модели пока гоняю только часть стадий, так что часть выводов - из анонса и первых замеров, а не из трёх месяцев в бою. Где что - помечаю.
Что нового в Opus 5 по сравнению с Opus 4.8
Opus 5 - это новая старшая модель Anthropic. Вышла 24 июля 2026, уже доступна в Claude Code и на сайте. Цена осталась прежней: 5 долларов за миллион входных токенов и 25 за миллион выходных - как у Opus 4.8 и вдвое дешевле, чем у Fable 5. Главный прирост - в агентском кодинге и работе с компьютером, а не в красоте пересказов.
По цифрам разница с 4.8 заметная. На SWE-bench Pro Opus 5 берёт 79.2% против 69.2% у Opus 4.8 - это плюс десять пунктов на задачах, где надо не угадать ответ, а реально доковырять баг в репозитории. На SWE-bench Verified он выбивает где-то 96% против примерно 88.6% у 4.8 (тут цифры по разным замерам чуть пляшут, 96 или 97 - блог-чек потом сверит по первоисточнику). Плюс у модели самый низкий показатель рассогласованного поведения, что Anthropic мерила - 2.3. Для того, кто пускает агента с правами на файлы и терминал, это не абстракция: меньше шансов, что железка пойдёт делать что-то, о чём её не просили.
Ещё появился регулятор усилия - low / medium / high прямо в запросе. Хочешь - крутишь модели мозги на максимум под сложную задачу, хочешь - прикручиваешь на рутине, чтобы не переплачивать.
Почему Opus 5 дешевле за задачу, если цена за токен та же, что у 4.8
Потому что итоговый счёт складывается не из цены токена, а из числа токенов и шагов, которые модель сожгла на задачу. Opus 5 доходит до результата за меньше попыток и меньше болтовни вслух. На бенче GDPval режим xhigh тратит на 25% меньше выходных токенов, чем max, при той же выработке. Тариф тот же, но путь короче - вот и дешевле за выполненную задачу.
Anthropic приводит и сравнение с большой моделью: на CursorBench 3.2 Opus 5 на максимальном усилии подбирается к пику Fable 5 в пределах половины балла, но примерно вдвое дешевле за задачу. На компьютерном OSWorld 2.0 он вообще обходит пик Fable 5, укладываясь где-то в треть бюджета. Отдельно отмечают усиленную самопроверку: модель чаще сама ловит свою же ошибку и не гоняет лишний цикл правок.
Для меня это самый важный пункт. Мой пайплайн ходит в модель по многу раз на одну статью: ресёрч, план, черновик, фактчек, ревизия. Если каждый такой заход стал на пару шагов короче, экономия на claude api набегает не на процентах, а на объёме. Причём заметно её не по прайсу (он не менялся), а по счётчику израсходованных токенов за прогон. Тот же принцип, кстати, работает и в обратную сторону: год назад я считал, стоит ли ради экономии вообще уходить с Claude на открытую модель - про Kimi K3 против Opus 4.8 писал отдельно.
Стоит ли обновлять production-пайплайн сразу после релиза
Скорее да, но поэтапно, а не в лоб в день релиза. Технически апгрейд копеечный: в вызове anthropic api меняется только id модели - claude-opus-4-8 на claude-opus-5, окно в миллион токенов на месте, ломать интеграцию не надо. Риск ровно один: у Opus 5 сильнее самопроверка и thinking включён по умолчанию, поэтому структура ответа может немного уехать. Если у тебя парсер выдёргивает из ответа JSON или блок по шаблону - перепроверь его до раскатки.
Пара нюансов, на которые я напоролся глазами в доке ещё до переключения. Thinking теперь дефолт, и попытка отрубить его на высоких уровнях усилия отдаёт 400-й ошибкой - то есть старый код, который жёстко гасил размышления ради скорости, огребёт. Зато добавили автоматический фолбэк: если запрос словили отказом, его можно увести на резервную модель, а не ронять весь прогон. Я до этого сам городил такую защиту руками, как ловил stop_reason=refusal и падал на запаску, так что для меня это прям в тему.
Как делаю я. Сначала перевожу на новую модель некритичные стадии - генерацию черновика, где ошибка стоит дёшево и видна глазами. Смотрю пару дней, что вывод не поехал. И только потом трогаю стадию проверки, которая решает, публиковать статью или нет. Раскатать всё разом на релизе - это ставить на то, что у нового поведения нет ни одного острого угла. Я так не ставлю.
Что даёт режим Opus 5 Fast и когда он окупается
Fast - это режим, где Opus 5 отвечает примерно в 2.5 раза быстрее, но за двойную цену: 10 долларов за миллион входных токенов и 50 за миллион выходных вместо 5 и 25. Никакого прироста качества, ты доплачиваешь ровно за скорость ответа. Окупается он там, где ты платишь за ожидание живого человека, а не за фоновую пачку задач по расписанию.
Смотри на это через тех, кто ждёт у экрана. Сидишь в Claude Code, гоняешь агента по коду и залипаешь на спиннер - вот тут Fast режет ожидание вдвое, и это честно окупается твоим временем. А мой ночной cron, который в три часа ночи молотит черновики, никуда не торопится - платить ему двойной тариф за скорость было бы просто спуском денег в трубу. Так что у меня Fast если и появится, то на живых, интерактивных кусках, а не на фоне.
Тем, кто сидит на claude код подписке, а не на голом api, важно другое: на планах Max новый Opus 5 становится дефолтной моделью, а на Pro - самым сильным доступным вариантом. То есть даже без ковыряния в API ты уже получаешь его в Claude Code. Как это ляжет на claude code лимиты в реальном использовании - вопрос отдельный, тут я жду своих же замеров за неделю, врать не буду.
Как я решаю это на своём агентском пайплайне
Мой пайплайн изначально живёт по принципу "дорогой оркестратор, дешёвые исполнители": тяжёлое думание - на старшей модели, рутину раздаю моделям попроще, чтобы не жечь лимит. Про эту раскладку писал отдельно - как раздать работу Haiku и Sonnet и не жечь Opus. Opus 5 в эту схему ложится без переделки: обновляю ровно те стадии, что и так сидели на Opus, а дешёвые оставляю дешёвыми.
Сверху добавляется регулятор усилия. Стадии, где нужна голова - фактчек, финальная ревизия, - крутятся на high. Механические шаги вроде причёсывания метаданных спокойно живут на medium или low, и там расход падает ещё. Получается, апгрейд экономит дважды: сама модель короче идёт к цели, и я руками не даю ей думать там, где думать не над чем.
Если совсем честно, главный выигрыш для petпроекта даже не в деньгах, а в том, что стадия проверки стала злее к самой себе. Меньше циклов "написал - сам нашёл косяк - переписал" означает меньше прогонов на статью, а это и есть та самая экономия за задачу. Прайс не изменился, а счёт в конце месяца - должен.
Короче, пора ли обновляться
Да, но с холодной головой. Цена за токен - как у 4.8, за задачу выходит дешевле, id модели меняется одной строчкой. Раскатывай поэтапно, начни с некритичных стадий и перепроверь парсеры вывода из-за усиленной самопроверки. Fast бери только туда, где ждёт живой человек, а не ночной cron. А для совсем тяжёлых задач, где агент должен пахать сам сутками, Anthropic по-прежнему кивает на старшую Fable 5 - Opus 5 метит в рабочую лошадку на каждый день, и на роль этой лошадки он подходит.
Я себе план набросал: некритичные стадии уже на новой модели, проверку переключу после недели наблюдений, а по claude code лимитам вернусь с реальными цифрами, когда накопится статистика прогонов. Как обычно - следите за новостями, а я пойду смотреть на счётчик токенов.
Частые вопросы
Сколько стоит Claude Opus 5?
5 долларов за миллион входных токенов и 25 за миллион выходных - как у Opus 4.8 и вдвое дешевле Fable 5. Режим Fast стоит вдвое дороже ($10/$50) и отвечает примерно в 2.5 раза быстрее.
Какой id у модели Opus 5 в API?
claude-opus-5. Чтобы перейти с Opus 4.8, в вызове меняется только id модели, окно контекста в 1 млн токенов сохраняется.
Opus 5 или Fable 5 для агента, который работает сам сутками?
Для самых тяжёлых автономных задач Anthropic по-прежнему советует Fable 5. Opus 5 - рабочая лошадка для кодинга и агентских задач по цене вдвое ниже Fable 5.
