MiniMax Code обошёл Codex и Claude Code в тестах и стоит в разы дешевле: разбираю, за счёт чего разрыв
MiniMax Code решает на 13,4 процентных пункта больше задач и стоит в 2-10 раз дешевле Codex и Claude Code по бенчмарку самого MiniMax на 30 задачах, но независимый тест показывает более простой код: слабее хеширование паролей, меньше интеграционных тестов и поверхностные фиксы багов вместо поиска первопричины.
MiniMax Code открыли на GitHub 21 сентября 2026: разбираю бенчмарк на 30 задачах против Codex и Claude Code, независимый тест Kilo Code и что теряешь в качестве кода за 10-кратную экономию.

MiniMax Code обошёл Codex и Claude Code в тестах и стоит в разы дешевле: разбираю, за счёт чего разрыв
У меня в канале про вайб-кодинг за неделю два раза всплыл один и тот же скриншот: таблица, где открытый MiniMax Code обгоняет Codex и Claude Code по проценту решённых задач, делает это быстрее и стоит в разы дешевле. Разрыв реально есть - но он не весь про "открытая модель обогнала гигантов". Часть разрыва - это честная экономия на дешёвых токенах и лёгкой обвязке. Часть - маркетинговый тайминг: цифры выложил сам MiniMax за два дня до того, как открыл исходники инструмента. А в независимом тесте, где кто-то кроме продавца сравнивал качество кода, а не только цену, MiniMax проседает именно там, где цена ошибки самая высокая - в безопасности и отладке. Разбираю по цифрам, что из этого правда, а что нет, и когда экономия вообще стоит того.
MiniMax Code, Codex и Claude Code: что показывает бенчмарк на 30 задачах
MiniMax 19 сентября 2026 года опубликовала результаты прогона 30 задач через три инструмента: MiniMax Code решила 76,7% задач за 4 минуты 33 секунды и $1,83 за прогон, Codex - 66,7% за 6:43 и $3,47, Claude Code - 63,3% за 9:38 и $18,34. Разница в цене между MiniMax Code и Claude Code - в 10 раз, при этом MiniMax решает на 13,4 процентных пункта больше задач.
| Метрика | MiniMax Code | Codex | Claude Code |
|---|---|---|---|
| Успешных прогонов (30 задач) | 76,7% | 66,7% | 63,3% |
| Среднее время на задачу | 4:33 | 6:43 | 9:38 |
| Стоимость одного прогона | $1,83 | $3,47 | $18,34 |
| Цена входных токенов (модель по умолчанию) | ~$0,26-0,30 / 1М | не раскрыта MiniMax | не раскрыта MiniMax |
| Открытый исходный код | да, MIT, с 21.09.2026 | нет | нет |
Цифры красивые, и именно эта таблица разошлась по каналам. Но у неё есть слепое пятно, о котором ниже.
Откуда взялись эти цифры и почему я им не доверяю на все сто
Прямой ответ: бенчмарк на 30 задачах - это собственное исследование MiniMax, опубликованное самой компанией 19 сентября 2026 года, за два дня до того, как MiniMax открыла исходники MiniMax Code под MIT-лицензией (21 сентября). Независимой перепроверки цифр я не нашёл, а методология - какие 30 задач, кто их придумал, какая версия каждого инструмента стояла - в публикации не раскрыта.
Это не значит, что цифры врут. Это значит, что к ним нужно относиться как к пресс-релизу, а не к независимому аудиту: компания сравнивает свой продукт с чужими на своём же наборе задач и публикует это ровно в момент запуска open source версии - классический маркетинговый тайминг. Для сравнения: в моём разборе выхода Kimi K3 я уже писал, что открытые модели любят зайти именно на том индексе или наборе задач, где разрыв с лидером минимальный, а после проверки по-честному экономика часто сходится иначе - см. разбор Kimi K3 против Opus 4.8. Поэтому дальше я ищу не рекламные цифры, а независимые тесты, где кто-то кроме продавца гонял модель на своих задачах.
Что показал независимый тест Kilo Code
Независимый тест Kilo Code на трёх практических задачах на TypeScript даёт MiniMax M2.7 90% качества Claude Opus 4.6 за 7% его цены: 87 баллов из 100 против 97, $0,27 за прогон против $3,67. Это ближе к правде, чем "MiniMax выигрывает", но и не "MiniMax бесплатная замена".
По задачам разрыв не абстрактный, а предметный:
- Система обработки событий (WebSocket, rate limiting, асинхронный конвейер): MiniMax - 28 из 35 баллов, у него 20 unit-тестов и простая архитектура без graceful shutdown. Claude Opus 4.6 - 33 из 35, модульная структура и 41 интеграционный тест с реальными HTTP-запросами вместо изолированных unit-тестов.
- Расследование багов по логам (6 подложенных ошибок): обе модели нашли все 6 из 6. MiniMax - 28 из 30 баллов, Claude - 29 из 30. Здесь MiniMax даже элегантнее: ошибку накопления с плавающей точкой он поправил переводом в целые числа (центы), тогда как Claude использовал округление после расчётов.
- Аудит безопасности (10 уязвимостей по OWASP): обе модели нашли все 10 из 10 и правильно их категоризировали, но чинили по-разному. MiniMax захешировал пароли через SHA-256, Claude - через scrypt со случайной солью (сам MiniMax в комментарии к своему решению признал, что bcrypt был бы лучше). Rate limiting MiniMax поставил только на вход, Claude - на каждый чувствительный эндпоинт, включая регистрацию. Итог по баллам: 31 из 35 у MiniMax против 35 из 35 у Claude.
Цена токенов у моделей за этим стоит принципиально разная: у MiniMax M2.7 - $0,30 за миллион входных и $1,20 за миллион выходных токенов, у Claude Opus 4.6 - $5 и $25 соответственно, то есть в 17 и 21 раз дороже. Похожие цифры у соседней версии, MiniMax M2 по прайсу OpenRouter стоит $0,255 за миллион входных и $1,02 за миллион выходных токенов - тот же порядок.
Где MiniMax теряет в отладке
Прямой ответ: MiniMax находит баг так же часто, как Claude, но чаще чинит симптом, а не причину - в независимом сравнении на реальных задачах Claude находил корневую причину в 70% случаев отладки, MiniMax заметно реже.
Показательный пример из этого сравнения: race condition в Node.js-сервисе. MiniMax предложил обернуть проблемный участок в setTimeout - код перестаёт падать, но гонка данных никуда не делась, просто стала реже воспроизводиться. Claude нашёл пропущенный await и исправил именно его - гонка исчезла, а не спряталась. В генерации нового кода с нуля разница меньше: оба инструмента выдают рабочий код с первой попытки примерно в 80% случаев на типовых задачах вроде REST-эндпоинтов и React-компонентов, но у Claude более идиоматичные имена переменных и обработка ошибок по умолчанию, а MiniMax чаще пропускает граничные случаи, если их явно не попросить.
Это ровно тот тип разрыва, который не виден в бенчмарке "решил / не решил": оба инструмента формально закрывают задачу, разница всплывает только когда смотришь на диф глазами, а не на зелёную галочку CI.
Стоит ли переносить агентский пайплайн на MiniMax Code
У меня весь конвейер статей на этом блоге - Claude Code с навыками (skills) и cron-обвязкой: черновики генерируются раз в 2 часа, минимум 2 черновика в день на площадку по квоте, публикация ограничена 5 статьями в день на площадку. К моменту, когда я пишу этот текст, на sunm8.ru опубликовано 72 статьи, а в общем беклоге пайплайна лежит 428 тем. То есть это не разовая задача, а конвейер, где счёт за токены складывается ежедневно - и вопрос "а не дешевле ли на MiniMax" я себе задаю не первый раз, писал похожее и про реальную стоимость прогона агента, и про то, что выгоднее между Claude Code, Codex и Cursor.
Мой критерий простой: если ошибку в любом случае находят оба инструмента и цена ошибки - это плохо сформулированный абзац, который я перечитаю на саморедактуре, я готов платить в 10-20 раз меньше и мириться с чуть менее идиоматичным результатом. А вот там, где нашедший баг инструмент ещё и должен его правильно починить без моей перепроверки построчно - в коде самого пайплайна, в скриптах, которые трогают боевую БД, - экономия на модели превращается в экономию на количестве часов, которые я потом трачу на ревью её диффа. Ровно этот принцип - дорогой оркестратор для решений, дешёвые исполнители для рутины - я уже закладывал в конвейер, когда писал про разделение оркестратора и дешёвых исполнителей.
Для генерации текста статей MiniMax Code теоретически подходит: это не security-критичная задача, и 90% качества за 7% цены здесь может быть честной сделкой. Но у моего пайплайна голос и фактчек - это не только текст, а ещё соблюдение секьюр-фильтра и фактчек-скоркарты на каждом черновике, и пока я не увидел независимого теста именно этого сценария (длинный русскоязычный текст с факт-чеком), менять модель под живой конвейер ради экономии, которую я не могу измерить на своих задачах, я не буду.
Когда экономия оправдана, а когда нет
Экономия оправдана там, где итог легко проверить автоматически или глазами за секунды: генерация бойлерплейта, первый черновик функции, юнит-тесты на очевидные случаи, объяснение чужого кода. Здесь MiniMax Code по независимым тестам даёт сравнимый результат в разы дешевле, и 76,7% против 63,3% из собственного бенчмарка MiniMax - если он вообще воспроизводится на ваших задачах - тут не так важны, потому что цена промаха низкая: не понравился результат, перегенерировал.
Экономия не оправдана там, где ошибка дорогая и незаметная: аутентификация, платежи, миграции боевой БД, откаты при частичных сбоях. Именно тут независимый тест Kilo Code показал разницу не в "нашёл или не нашёл", а в "починил правильно или починил дешевле": SHA-256 вместо scrypt формально работает и формально закрывает пункт чек-листа, но это ровно тот случай, когда автоматический тест зелёный, а продакшен уязвим. На таких задачах 10-кратная экономия на токенах может обернуться часами ручного ревью или, хуже, инцидентом, который стоит на порядки больше сэкономленных долларов.
Так что если коротко: MiniMax Code - это не замена Claude Code, а ещё один инструмент в наборе, который стоит доставать именно тогда, когда цена ошибки низкая, а объём задач большой. Именно так я и буду его пробовать дальше - не на всём конвейере разом, а на конкретных низкорисковых кусках, где можно честно сравнить результат на своих задачах, а не на чужом пресс-релизе.
Частые вопросы
MiniMax Code бесплатный?
Сам инструмент - open source по MIT-лицензии, но токены API MiniMax платные: около $0,26 за миллион входных токенов и $1,02 за миллион выходных - на порядок дешевле Claude Opus 4.6.
Можно ли использовать MiniMax Code вместо Claude Code в проде?
Для генерации кода и поиска багов - да, независимый тест находит те же ошибки. Для аутентификации, платежей и других security-критичных мест разница в качестве решений ощутима, там лучше оставить дорогую модель.
MiniMax Code и модель MiniMax M2 - это одно и то же?
Нет. M2/M2.7 - это модель, MiniMax Code - открытый терминальный агент вокруг неё, вышел в открытый доступ 21 сентября 2026 года под MIT-лицензией.
Как готовился материал: черновик собран моим AI-конвейером по темам и заметкам из практики, факты сверены с первоисточниками, финальный текст я прочитал, поправил и утвердил перед публикацией. Обложку к статье тоже рисует нейросеть. Про сам конвейер — в разделе обо мне.
