· 1 мин

Kimi K3 дешевле Opus 4.8: стоит ли переносить агентский пайплайн с Claude Code на открытую модель

Пока нет. Kimi K3 обошёл Opus 4.8 лишь на один балл индекса Artificial Analysis (57 против 56) и дешевле не вдвое, а примерно на 40% за токен. Если пайплайн живёт на подписке Claude Code, узкое место - недельные лимиты, а не счёт за API, и дешёвая модель поможет только на объёмных стадиях, вынесенных на поштучный API. Правильный ход - гибрид, а не переезд.

Kimi K3 обошёл Opus 4.8 на балл и дешевле за задачу. Разбираю, стоит ли переносить агентский пайплайн с Claude Code на открытую модель и почему цена за токен не чинит экономику подписки.

Kimi K3 дешевле Opus 4.8: стоит ли переносить агентский пайплайн с Claude Code на открытую модель

Kimi K3 вышел открытым, на индексе Artificial Analysis обошёл Opus 4.8 на один балл и стоит примерно вдвое дешевле за задачу. Звучит как повод унести мой headless-пайплайн с Claude Code на дешёвую модель и радоваться сэкономленным деньгам. Я сел, пересчитал экономику по-честному - и никуда ничего не понёс. Рассказываю, где открытая модель реально режет счёт, а где это иллюзия.

Что случилось с Kimi K3 и почему все заволновались

Kimi K3 - это открытая MoE-модель от Moonshot AI на 2.8 триллиона параметров, вышла 17 июля 2026, полные веса выкладывают до 27 июля. На сводном индексе Artificial Analysis она набрала 57 баллов против 56 у Opus 4.8. Впервые открытая модель встала вровень с топовой закрытой - вот отсюда и весь шум.

Контекст помогает не терять голову. Ещё в начале июня моделей с оценкой 50+ на этом индексе было всего две - от Anthropic и OpenAI. За восемь дней их стало шесть: подтянулись Grok 4.5, GPT-5.6, Muse Spark 1.1 и вот K3. Разрыв между лидером и догоняющими схлопнулся с четырёх баллов до одного. То есть история не про то, что K3 - король горы. История про то, что гора стала плоской, и открытая модель на неё наконец залезла.

Kimi K3 правда обошёл Opus 4.8?

И да, и нет. По сводному индексу Artificial Analysis K3 (57) действительно выше Opus 4.8 (56) - ровно на один балл. Но выше их обоих стоят Fable 5 (60) и GPT-5.6 Sol (59). То есть K3 обошёл конкретно Opus, но не фронтир. "Обошёл" тут - про один индекс и один балл, а не про то, что модель объективно умнее всех в комнате.

На агентских бенчах картина такая же неоднозначная. На SWE-bench K3 берёт 67.5 со своей связкой KimiCode - это уровень Opus 4.8 по кодингу, launch-day тестеры так и пишут. Модель выигрывает марафонские бенчи на длинную дистанцию (SWE Marathon, Program Bench), где агент планирует и правит код много шагов подряд. Но на Terminal-Bench 2.1 она отстаёт от GPT-5.6 Sol на полбалла, а на DeepSWE (глубокое понимание чужого репозитория) проседает. И главное: независимых head-to-head замеров пока мало, большинство цифр - это тесты первых дней. Для агентского пайплайна, где важна не средняя оценка, а стабильность вызова инструментов на сотнях итераций, этого мало, чтобы делать выводы.

Kimi K3 вдвое дешевле Opus 4.8 - это правда?

За токены Kimi K3 стоит 3 доллара за миллион входных и 15 за миллион выходных. Opus 4.8 - 5 и 25 соответственно. Это не вдвое, а примерно на 40% дешевле. "Вдвое" берётся из другой метрики - цены за задачу на индексе Artificial Analysis, около 0.94 доллара: K3 экономнее по числу токенов на ответ, поэтому итоговый чек за задачу выходит примерно в половину от Opus. Per-token и per-task - это разные вещи, и путать их дорого: на своей нагрузке ты получишь свою экономию, а не рекламную.

Плюс у Anthropic давно есть чем ужимать счёт и без смены модели. Кэширование промпта режет цену закэшированного входа на 90%, батч-обработка - минус 50% на всё. Если у тебя пайплайн с общими системными промптами (а у агентов он такой почти всегда), реальная цена за токен у Opus заметно ниже прайса из таблицы. Так что честное сравнение - это не "3 против 5", а "3 против 5 с кэшем и батчем". Разрыв сужается.

Открытые веса - это же бесплатно, да?

Нет, и это второй крючок, на который легко попасться. Открытые веса Kimi K3 - это 2.8 триллиона параметров, около 1.4 ТБ в формате MXFP4. Чтобы поднять модель у себя, нужно минимум восемь видеокарт H100 с тензорным параллелизмом, а сам Moonshot рекомендует ноды от 64 ускорителей. Для соло-разработчика это не план, а фантазия про машинный зал в гараже.

Да, модель разреженная: из 896 экспертов на токен активируется всего 16, это примерно 50 миллиардов активных параметров. Но активные параметры описывают только компьют на токен, а грузить в память всё равно надо весь чекпоинт. Так что на практике "открытую" модель ты дёргаешь через тот же хостед-API - Moonshot или OpenRouter, - просто платишь меньше за токен. Открытость даёт другое: нет вендор-лока, можно выбирать провайдера инференса и торговаться за цену, и модель никуда не денется, даже если Moonshot завтра передумает. Это ценно. Но это не "бесплатно" и на счёт соло-мейкера напрямую не влияет.

Почему дешёвый токен не чинит мою экономику

Потому что мой пайплайн живёт не на поштучном API, а на подписке Claude Code с недельными лимитами. Цена за токен у Kimi в этом уравнении просто не участвует: я плачу фикс, а упираюсь я не в счёт, а в лимиты. Дешёвый K3 не сделает подписку дешевле - он вообще про другой способ платить.

Я про эти лимиты уже писал не раз: как субагенты, плодящие субагентов, сожгли 20% недельного лимита и как скиллы съедали недельный лимит за четыре дня. Узкое место у меня всегда там - не в деньгах за токены, а в потолке подписки. Чтобы дешёвый K3 реально помог, надо вынести часть работы с подписки на метрический API и на свою обвязку. А это значит попрощаться со скиллами, cron-обёртками и всем тулингом Claude Code, ради которого я на этой подписке и сижу. Экономия за токен есть, но платишь ты за неё временем на переезд и потерянным удобством.

Мораль простая: сравнивать надо не цены моделей, а модели затрат. Подписка с лимитами против метрического API с DIY-хартнессом - это разные экономики, и дешёвый токен выигрывает только в одной из них.

Куда я реально дену Kimi K3

В дешёвые массовые подзадачи, где планка качества ниже и Claude Code для них - из пушки по воробьям. Фан-аут ресёрча, черновая классификация, разбор шума в беклоге тем, первичная сортировка - всё это можно гонять через поштучный API, и вот там 40% экономии считаются по-настоящему, потому что это уже деньги, а не лимиты.

А оркестрацию, финальную сборку черновика и контроль качества я оставляю на Opus и Claude Code - там, где ошибка стоит дороже сэкономленного цента и где мне нужны скиллы и вся обвязка. Получается гибрид: дешёвая открытая модель на грязной работе объёмом, дорогая закрытая на тонкой. Не переезд, а разделение труда. И вот это, кажется, и есть правильный ответ на "пора пересчитать экономику" - не выкинуть Opus, а перестать использовать его там, где хватит модели за треть цены.

Стоит ли переносить агентский пайплайн на открытую модель

Пока нет. Kimi K3 - отличная новость: открытая модель дышит в затылок топам и роняет цену за токен, конкуренция давит на прайсы, всем нам от этого лучше. Но "обошёл Opus на один балл" и "вдвое дешевле за задачу" не складываются в "унеси весь пайплайн на выходных".

Считай не за токен, а за задачу и за своё узкое место. Если ты на поштучном API и упираешься в счёт - да, присмотрись к K3, особенно на объёмных не самых ответственных стадиях. Если ты, как я, на подписке Claude Code и упираешься в лимиты - дешёвая модель поможет только там, где ты сознательно вынесешь работу с подписки на API. Всё остальное - красивые заголовки. А я пойду доить кэш и батч на Opus и пересчитывать, какие стадии не жалко отдать открытой модельке. Следите за новостями.

Частые вопросы

Можно ли запустить Kimi K3 на своём сервере?

Для соло-разработчика практически нет: это 2.8 триллиона параметров, около 1.4 ТБ весов и минимум 8 видеокарт H100, а Moonshot советует ноды от 64 ускорителей. Открытую модель проще дёргать через хостед-API - Moonshot или OpenRouter.

Сколько стоит Kimi K3 против Claude Opus 4.8?

Kimi K3 - 3 доллара за миллион входных токенов и 15 за миллион выходных. Opus 4.8 - 5 и 25. Это около 40% экономии за токен; разница сужается, если у Opus включить кэш промпта (минус 90% на кэш) и батч (минус 50%).

K3 лучше Opus 4.8 для агентского кодинга?

На SWE-bench K3 (67.5) примерно на уровне Opus и выигрывает марафонские бенчи, но отстаёт на Terminal-Bench 2.1 и хуже понимает большие репозитории. Независимых замеров пока мало - это в основном тесты первых дней.

Влад Новиков
Влад Новиков aka sunm8
Пишу про AI-разработку без глянца. Новые разборы — сначала в канале.
Подписаться