GPT-6 Astra против Cursor AI и Claude Code: стоит ли тестировать новую нейросеть для кода
Нет, полностью переходить с Claude Code на GPT-6 Astra рано: по общим агентным бенчам модели идут вровень, а не Astra впереди, задачи у неё на 75% дороже прошлой версии OpenAI. Пробовать стоит точечно - на дешёвых нетворческих шагах вроде факт-сверки. Пользователям Cursor AI отдельно стоит следить за 12 ноября 2026 - датой отключения старых моделей в редакторе.
GPT-6 Astra от OpenAI: бенчмарки против Claude Code, цена API и разрыв Cursor AI с OpenAI 12 ноября 2026. Стоит ли тестировать эту нейросеть для кода в агентском пайплайне.

3 сентября 2026 OpenAI выкатила GPT-6 Astra и сразу назвала её "самой умной и самой согласованной моделью в мире". Я гоняю статейный конвейер на Claude Code уже давно и каждую новую громкую модель проверяю по одному вопросу: она реально годится в мой агентский пайплайн или это ещё один повод для хайпа на неделю. С GLM-5.3 Flash и Kimi K3 я это уже проходил, теперь очередь Astra - и заодно Cursor AI, у которого с OpenAI как раз рвутся отношения.
Что такое GPT-6 Astra и чем она отличается от предыдущих моделей OpenAI
GPT-6 Astra - это флагманская модель OpenAI, вышедшая в ограниченном превью 3 сентября 2026 и открытая платным подписчикам ChatGPT на следующий день, 4 сентября, в урезанной версии, которая отказывает в части запросов по кибербезопасности. У модели контекст на 1 050 000 токенов, максимальный вывод 128 тысяч токенов и срез знаний на 30 апреля 2026.
По словам вице-президента OpenAI по исследованиям Эйдана Кларка, тренировка Astra стала крупнейшим прогоном компании - впервые предобучение шло на кластере из более чем 100 000 GPU на площадке Stargate в Техасе. Цена в API кусается: 10 долларов за миллион входных токенов и 50 за миллион выходных, кэш - доллар, batch-режим вдвое дешевле, а Fast-режим - вдвое дороже при скорости в 2,5 раза выше стандартной.
GPT-6 Astra против Claude Code: что показывают бенчмарки
По данным Artificial Analysis (сентябрь 2026), в Coding Agent Index Astra набирает 67 баллов - примерно на уровне Claude Opus 5 - и выходит на результат Fable 5 при цене больше чем вдвое ниже. По токенам на задачу модель на 70% экономнее предыдущей GPT-5.6 Sol. В общем Intelligence Index у Astra 61 балл - столько же, сколько у GPT-5.6 Sol, и на 5 баллов ниже Claude Fable 5.1.
Дальше начинается разнобой. На AA-Omniscience (бенчмарк галлюцинаций) в режиме максимального effort доля галлюцинаций падает с 92% до 51%, точность растёт на 4 пункта - это серьёзный скачок. А вот стоимость выполнения одной задачи выросла на 75% относительно прошлой модели, несмотря на экономию по токенам на вывод. На агентных бенчах разброс похожий: AutomationBench - 41,4% против 18,1% у GPT-5.6 Sol, Terminal-Bench 4.0 - 57,7% против 55,8% у Claude Fable 5.1 и 37,3% у GPT-5.6 Sol. А на GDPval-AA v2 - тесте долгих офисных задач - Astra наоборот теряет около 80 очков Elo, а на Humanity's Last Exam прибавляет всего 6 пунктов. Модель, которая почти обогнала Claude в одном агентном бенче и просела в соседнем - не повод бежать переключать пайплайн, а повод смотреть, какой именно бенч ближе к твоим задачам.
Свёл цифры в таблицу, чтобы не листать туда-сюда:
| Бенч | GPT-6 Astra | Claude (Opus 5 / Fable 5.1) | GPT-5.6 Sol |
|---|---|---|---|
| Coding Agent Index | 67 | ~67 (Opus 5) | - |
| Intelligence Index | 61 | 66 (Fable 5.1) | 61 |
| Terminal-Bench 4.0 | 57,7% | 55,8% (Fable 5.1) | 37,3% |
| AutomationBench | 41,4% | - | 18,1% |
| Цена задачи vs предыдущая модель | +75% | - | база |
Прочерк там, где по конкретному бенчу цифра по Claude или GPT-5.6 Sol не публиковалась - выдумывать её смысла нет, это тоже часть картины: не по всем моделям бьют одни и те же тесты.
Cursor AI и GPT-6 Astra: что происходит после разрыва с OpenAI
Тут отдельная засада. 28 августа 2026 OpenAI уведомила SpaceX - материнскую компанию Cursor после её покупки - о планах свернуть контракт на поставку своих моделей в редактор, с предложенной датой отключения 12 ноября 2026. Мы разбирали эту историю в статье OpenAI отключает Cursor от GPT-моделей: фактически OpenAI не планирует поставлять новые модели в Cursor по старому нативному соглашению.
На момент выхода Astra Cursor документирует OpenAI BYOK (свой ключ API) только для нерассуждающих чат-моделей, а официального анонса поддержки Astra, доступа через Codex или отдельного шлюза для неё в редакторе нет. То есть даже если вставить свой ключ OpenAI в Cursor руками, гарантий, что там заведётся именно Astra в агентном режиме, а не обрезанный чат-вызов, никто не даёт. Кто сидел на Cursor с GPT под капотом, для того вопрос "куда девать нейросеть для кода" сейчас практический, а не гипотетический: до 12 ноября 2026 модели ещё работают по старому контракту, а что будет после - зависит от того, договорятся ли Cursor и OpenAI о новых условиях или редактор пересядет на другого поставщика моделей.
Здесь важно разделить два разных вопроса, которые легко слипаются в один. Первый - стоит ли пробовать Astra как нейросеть для кода вообще, через голый API, в обход любого редактора. Второй - что делать конкретно пользователям Cursor, у которых выбор модели и так был встроен в продукт и теперь этот встроенный выбор рушится. Для первого вопроса разрыв Cursor с OpenAI вообще не аргумент ни за, ни против Astra - он просто не имеет отношения к тем, кто гоняет модели через API напрямую, как в моём пайплайне.
Стоит ли тестировать нейросеть для кода GPT-6 Astra в агентском пайплайне
У меня на сервере весь конвейер статей headless: cron дёргает генератор раз в 2 часа, и каждая площадка получает не больше gen_quota_<platform> черновиков в день - по умолчанию 2. Модель в этой схеме не вкопана намертво, она параметр вызова, и это единственная причина, по которой тест новой нейросети вообще стоит недорого. Ровно так же я гонял тест GLM-5.3 Flash и разбирал экономику Kimi K3 против Opus 4.8 - методика с бенчем на своих задачах давно обкатана, смотрите бенч 7 LLM на своих данных за вечер.
Cursor AI при этом остаётся отдельной историей - там нейросеть для кода намертво привязана к продукту редактора, и разрыв с OpenAI бьёт по пользователям Cursor, а не по тем, кто гоняет модели через голый API, как я. Из бенчей понятно, что Astra не рвёт Claude Code в клочья, а идёт вровень или чуть позади в зависимости от задачи - и это ровно тот случай, когда решает не общий балл, а конкретный тип работы: у меня это ресёрч, факт-чек и правка текста по комментам, а не написание кода с нуля.
Как я буду проверять GPT-6 Astra на своих задачах
План простой и без сюрпризов:
- прогнать через Astra те же три задачи из бенча GLM/Kimi - ресёрч факт-листа, правку черновика по комментам автора и генерацию meta-полей - и сравнить с результатом Claude Code на тех же входных данных;
- посчитать не цену за токен, а цену за принятую с первого раза задачу - подход, который я уже описывал в реальной стоимости прогона агента;
- если Astra окажется дешевле на однотипных, но не творческих шагах пайплайна (например, фактчек-сверка), отдать ей эти шаги через оркестратор, а не переезжать целиком - ровно так у меня уже разведены дорогие и дешёвые модели в статье про оркестратора и дешёвых исполнителей;
- закладывать на прогон около недели квоты, потому что
gen_quota_<platform>не резиновая, и тест новой модели не должен красть черновики у площадок, которые и так близки к дефициту. Отдельно у пайплайна естьgen_review_limit- анти-завал: если у площадки уже накопилось N черновиков в review, новые для неё не генерятся, пока очередь не разгребут, и тестовый прогон Astra эту защиту обходить не должен, иначе я сам себе устрою затор в очереди на проверку; - публикацию держать отдельно от генерации: у пайплайна свой потолок
publish_limit_<platform>в сутки, и даже если Astra нагенерит черновиков быстрее и дешевле, в прод они всё равно пойдут через тот же фильтр качества и по тому же лимиту, что и черновики от Claude - скорость генерации не значит скорость публикации.
Деталь, которую с наскока не проверить: разница между "модель хорошо решает бенч" и "модель хорошо встраивается в конкретный пайплайн" почти всегда всплывает не на первом прогоне, а на третьем-четвёртом, когда кончаются лёгкие кейсы и начинаются те, где нужно держать контекст фактов через несколько шагов подряд. Именно поэтому я держу правило: новую модель не сравнивают по одному прогону, минимум три однотипных задачи подряд, иначе решение принимается по шуму, а не по сигналу. С GLM-5.3 Flash так и вышло: на первой задаче модель выглядела достойно, а на третьей - там, где нужно было удержать в голове факт-лист из предыдущего шага, - поплыла.
Стоит ли переходить на GPT-6 Astra прямо сейчас
Нет, не прямо сейчас и не целиком. GPT-6 Astra интересна как вторая модель для конкретных нетворческих шагов пайплайна - там, где важна цена за задачу, а не творческая работа с голосом текста, - но по общим агентным бенчам она идёт вровень с Claude, а не обгоняет его, и стоит на некоторых задачах на 75% дороже предыдущей версии OpenAI. Для тех, кто сидел на Cursor с GPT под капотом, вопрос острее: после отключения 12 ноября 2026 без официальной поддержки Astra в редакторе выбор сужается до чужого ключа без гарантий или смены инструмента - и это отдельное решение, не связанное с тем, тестировать ли Astra через голый API.
Частые вопросы
Когда OpenAI отключит свои модели в Cursor?
OpenAI уведомила SpaceX (материнскую компанию Cursor) 28 августа 2026 о планах свернуть контракт на поставку моделей, с предложенной датой отключения 12 ноября 2026. Официальной поддержки GPT-6 Astra в Cursor на сентябрь 2026 нет.
Сколько стоит GPT-6 Astra в API?
10 долларов за миллион входных токенов и 50 за миллион выходных, кэшированный ввод - доллар, batch-режим вдвое дешевле, Fast-режим вдвое дороже при скорости в 2,5 раза выше стандартной.
Насколько GPT-6 Astra снижает галлюцинации по сравнению с предыдущей моделью?
На бенчмарке AA-Omniscience Astra в режиме максимального effort снижает долю галлюцинаций с 92% до 51% и повышает точность на 4 пункта - это сравнение с предыдущей моделью OpenAI, а не с Claude.
Как готовился материал: черновик собран моим AI-конвейером по темам и заметкам из практики, факты сверены с первоисточниками, финальный текст я прочитал, поправил и утвердил перед публикацией. Обложку к статье тоже рисует нейросеть. Про сам конвейер — в разделе обо мне.
