Дешёвая по токену, дорогая по задаче: как я считаю реальную стоимость прогона агента на Anthropic
Дешёвая по цене за токен модель часто выходит дороже по задаче: она генерирует больше токенов и чаще промахивается, а каждый ретрай прогоняет весь контекст заново. Считать надо не цену за миллион токенов, а стоимость завершённой задачи - все токены, ходы и повторы, поделённые на задачи, что реально закрылись без человека.
Дешёвая по цене за токен модель часто дороже по задаче: разбираю, почему прайс Anthropic врёт о тратах и как считать стоимость завершённой задачи, а не цену за миллион токенов.

Открываешь прайс Anthropic, видишь Haiku за доллар против Opus за пятёрку и думаешь: ну всё, переведу пайплайн на дешёвую модель и буду экономить впятеро. А через неделю смотришь на расход - и он не то что не упал, местами вырос. Знакомо? Мне - да.
Цена за токен в прайсе - это не цена задачи. Вопрос ведь не в том, какая клод-нейросеть дешевле в пересчёте на миллион токенов, а в том, какая дешевле в пересчёте на закрытую задачу: сгенерированный пост или починенный баг. И вот тут дешёвая по прайсу модель регулярно оказывается дорогой по делу. Ниже - как я это считаю у себя, без магии и без абсолютных цифр из моего биллинга (их не покажу, покажу кратности).
Триггер для этой заметки - канал llm_under_hood, где ребята гоняют модели по цене и качеству именно на агентских задачах, а не на синтетике. И там раз за разом вылезает одно и то же: модель, дешёвая по прайсу, на длинной агентской задаче считает заметно дольше и наматывает больше ходов, чем более дорогая. Вот это "дольше и больше ходов" - и есть та часть счёта, которую прайс не показывает.
Почему цена за токен в прайсе Claude API не равна цене задачи
Прайс Claude API считает токены, а не результат. На август 2026 Opus 4.8 стоит $5 за миллион входных и $25 за миллион выходных токенов, Sonnet 4.6 - $3/$15, Haiku 4.5 - $1/$5. Красиво и понятно. Только счёт в конце месяца зависит не от этих цифр, а от того, сколько токенов и сколько прогонов реально ушло на одну доведённую до конца задачу.
Первое, обо что спотыкаешься - выход дороже входа. У Opus выходной токен стоит впятеро дороже входного, $25 против $5. А агент генерирует именно выход: рассуждения, планы, черновики, код, объяснения, почему он передумал. Чем "разговорчивее" модель, тем сильнее эта пятикратная наценка бьёт по итогу. Дешёвая модель, которая на ту же задачу пишет вдвое больше "мыслей вслух", легко съедает свою же экономию на входе.
Второе - у задачи есть цена не только в токенах, но и в попытках. Если модель с первого раза не попала, ты платишь за второй прогон. И за третий. И вот здесь начинается самое интересное.
Что такое стоимость завершённой задачи и как её считать
Стоимость завершённой задачи (cost per task) - это суммарная цена всех токенов, всех ходов агента и всех ретраев, поделённая на количество задач, которые в итоге закрылись правильно. Не "сколько стоил один запрос", а "сколько стоила одна доведённая до результата работа". Именно эта метрика, а не цена за токен, определяет твой счёт - об этом отдельно пишут и в разборах вроде wavect "Cheaper Per Token, More Expensive Per Answer".
Формула у меня в голове простая: берёшь полный расход токенов на весь цикл (все ходы, все повторы), делишь на число задач, которые реально закрылись без человека. Ключевое слово - "реально закрылись". Задача, которую агент прогнал три раза, а на четвёртый ты доделал руками, стоила тебе четыре прогона и своё время, а в графу "успех" не попала.
Это у меня не абстракция - весь блоговый пайплайн, на котором вы эту статью читаете, собран из агентов. Один пост проходит через несколько автономных стадий: генерация черновика, автоматический фактчек по скоркарте, правки по моим комментам - и каждая стадия это отдельный запуск claude, а не один запрос. Цена задачи "выпустить пост" складывается из всех этих прогонов плюс ретраи внутри них, а не из строчки в прайсе за один вызов.
Из этого сразу вылезает то, чего в прайсе нет: доля успеха с первого раза (first-try success). Дорогая модель, которая чаще попадает с первой попытки, по цене за успешную задачу может выйти дешевле дешёвой, которая промахивается, ретраит, эскалирует и в итоге падает на человека - а каждая эскалация на живого человека стоит кратно дороже любого прогона модели. Так это и формулируют в разборах юнит-экономики агентов за 2026 год: поднять долю решённых задач важнее, чем срезать токены.
Почему дешёвая по токену модель выходит дороже по задаче
Дешёвая модель дорожает на ретраях. Модель без памяти на каждый повтор прожёвывает весь контекст заново - системный промпт, историю, файлы, всё. Один цикл ретраев способен умножить счёт до 50 раз: об этом прямо пишут в разборах token-экономики (Pebblous), и цифра не с потолка - стоимость каждого следующего прохода сопоставима с первым, а их бывает и десять.
Дальше складывается парадокс, который ловят целые компании: цены за токен падают, а счёт растёт. В одном разборе прямым текстом - цена инференса за три года рухнула примерно в тысячу раз, а корпоративные траты на ИИ за 2025 год выросли на 320% (The Modern Data Company). Forbes про то же: более дешёвые токены не гарантируют более дешёвых агентов. Потому что дешевеет строчка в прайсе, а дорожает всё, что вокруг неё - лишние ходы, лишние повторы, недозакрытые задачи.
У меня это выглядело так. Ставишь на кусок пайплайна модель подешевле, смотришь на цену за токен - кайф, минус проценты. Смотришь на цену за пост - а он тот же или хуже, потому что модель чаще не попадает в формат с первого раза, чаще уходит в лишние рассуждения и чаще требует второго прогона. Экономия на прайсе честно сожралась ретраями. Классическое "сэкономил рубль, потерял два".
Как я меряю реальную стоимость прогона агента в своём пайплайне
Меряю тремя числами на каждый тип задачи: сколько токенов ушло на один полный прогон, какая доля прогонов закрылась с первого раза, и сколько было ретраев на успех. Абсолютных сумм не привожу - и себе в статьи не тащу, и вам советую смотреть на кратности: во сколько раз один вариант дороже другого за одну и ту же закрытую задачу.
И чтобы не быть голословным - вот живые числа из этого же пайплайна. Из 59 черновиков, что дошли до автопроверки, 55 прошли скоркарту с первого прогона, и только четырём понадобился ретрай-цикл. Это и есть та самая доля успеха с первого раза, процентов 93, которую в прайсе не увидишь: она живёт в моих логах, а не в рейт-карте Anthropic. И каждый из тех четырёх лишних проходов - это ещё один полный прогон агента по всему контексту статьи, оплаченный отдельно. Урони дешёвая модель эти 93 процента хотя бы до семидесяти - и она добрала бы всю разницу ретраями, выйдя по цене за пост дороже, даже стоя втрое меньше за токен.
Дальше - роли. Я давно не гоняю всё на одной модели. Дорогая идёт туда, где цена ошибки высокая и ретрай дорогой: планирование, ревью, разбор сложного бага. Дешёвая - на массовую рутину, где задача узкая и промахнуться сложно. Как это раздавать по ролям, чтобы не жечь Opus на ерунде, я подробно разбирал в заметке про оркестратор и дешёвых исполнителей - там как раз про то, как отдать рутину Haiku и Sonnet.
И третье - кэш и повторное использование контекста. Половина расхода агента - это один и тот же кусок контекста, который едет в модель на каждом ходу. Когда я причесал скиллы и перестал тащить в контекст лишнее, недельный лимит стал уходить заметно медленнее - про это была отдельная история, как я стал тратить в четыре раза меньше. Это не про цену за токен вообще, это про то, сколько токенов ты вообще прокачиваешь через модель на задачу.
Когда дешёвая модель экономит, а когда жжёт бюджет
Дешёвая модель экономит на широких, повторяющихся, легко проверяемых задачах, где промах виден сразу и стоит дёшево. И жжёт бюджет там, где задача сложная, а ретрай дорогой - там дешёвая модель добирает ценой количества попыток. Правило грубое, но рабочее: чем дороже ошибка и дольше цепочка ходов, тем меньше смысла экономить на модели.
Отдельно - инструменты Anthropic, которые режут счёт без смены модели. Prompt caching срезает стоимость кэшированного ввода на 90%, batch-режим - на 50% (finout). Для агента с жирным статичным контекстом кэш бьёт по расходу сильнее, чем переезд на модель классом ниже. Прежде чем менять модель, я сначала смотрю, не гоняю ли я один и тот же контекст без кэша.
И ещё нюанс для тех, кто сидит не на API, а на подписке Claude Code. Там ты платишь не за токены, а упираешься в claude code лимиты - и логика меняется: узкое место не счёт, а недельный лимит. Дешёвая модель тут экономит не деньги, а твою квоту прогонов. Поэтому клод код подписка и голый API считаются по-разному, и переносить выводы из одного мира в другой - грабли.
Стоит ли переносить пайплайн с Opus на дешёвую модель
Не переносить целиком, а раздавать по ролям. Полный переезд с Opus на дешёвую модель ради строчки в прайсе почти всегда проигрывает по цене за задачу: экономия на входе съедается ретраями и просадкой first-try success. Выигрывает гибрид - дорогая модель на дорогие решения, дешёвая на дешёвую рутину.
Я эту дилемму проходил дважды и оба раза разбирал вслух. Когда вышел Opus 5, вопрос был ровно такой - и там дешевле за задачу оказалась как раз новая модель, а не старая, подробности в заметке Opus 5 дешевле за задачу, чем 4.8. А когда появилась открытая Kimi K3, которая по прайсу вдвое дешевле, я честно посчитал и решил не переезжать целиком - "вдвое дешевле" было per-token, а по задаче и по возне с инфрой картинка вышла другая.
Короче, вывод один и тот же, куда ни ткни. Прайс - это приманка, а не смета. Считай стоимость закрытой задачи: токены на весь цикл, доля успеха с первого раза, ретраи. Дешёвая по токену модель - это не скидка, это гипотеза, которую надо проверить своим расходом. У меня она подтверждается примерно в половине случаев, а в другой половине дешёвое выходит боком.
А я пойду дальше причёсывать роли в пайплайне - там ещё есть где ужаться.
Частые вопросы
Что дороже у Claude - входные или выходные токены?
Выходные. У Opus 4.8 (август 2026) выход стоит $25 за миллион против $5 за вход, впятеро дороже. Агент генерирует много именно выхода - рассуждения, планы, код, поэтому 'разговорчивая' модель бьёт по счёту сильнее, чем кажется по прайсу.
На сколько Haiku дешевле Opus по цене за токен?
Примерно впятеро: Haiku 4.5 стоит $1/$5 за миллион входных/выходных токенов, Opus 4.8 - $5/$25 (август 2026). Но это цена за токен, а не за задачу: на сложной работе Haiku добирает разницу количеством ретраев.
Как урезать счёт за агента, не меняя модель?
Prompt caching срезает стоимость кэшированного ввода на 90%, batch-режим - на 50%. Для агента с большим статичным контекстом кэш экономит сильнее, чем переезд на модель классом ниже.
Как готовился материал: черновик собран моим AI-конвейером по темам и заметкам из практики, факты сверены с первоисточниками, финальный текст я прочитал, поправил и утвердил перед публикацией. Обложку к статье тоже рисует нейросеть. Про сам конвейер — в разделе обо мне.
