GPT-6 Astra прошла Portal и Factorio без игрового API: что это значит для агентов и computer use
GPT-6 Astra прошла Portal за 23 часа 43 минуты и запустила ракету в Factorio Space Age за 10 часов - без игрового API, только через computer use: скриншоты, мышь и клавиатуру, как человек. На OSWorld 2.0 Astra набрала 72,6% против 65,7% у предыдущей модели. Агенты, которые сами тестируют интерфейс продукта, - уже не фантазия, а рабочий, хоть и ограниченный, паттерн.
GPT-6 Astra прошла Portal за 24 часа и Factorio без игрового API - только скриншоты, мышь и клавиатура. Разбираю бенчмарки computer use и свой опыт с AI-агентами, тестирующими интерфейс Telegram-бота.

GPT-6 Astra прошла Portal и Factorio без игрового API: что это значит для агентов и computer use
GPT-6 Astra прошла квест-головоломку Portal от начала до финальных титров за 23 часа 43 минуты и самостоятельно запустила ракету в Factorio Space Age примерно за 10 часов - без единой строчки специального игрового API. Модель просто смотрела на скриншоты и жала клавиши мышью и клавиатурой, как обычный игрок за монитором. Для агентов, которые работают не с играми, а с обычным софтом, это не забавный трюк для ленты, а прямой намек: тот же самый режим - computer use - уже двигает бенчмарки в сторону "агент сам протестирует твой интерфейс".
У меня самого на это не абстрактный интерес: часть моего конвейера статей и QA моего Telegram-бота уже гоняет агентов через Playwright, и я упираюсь ровно в те же вопросы - что агент реально видит на экране и сколько это стоит. Разбираюсь, что именно показала Astra в играх, что за этим стоит технически и где проходит граница между "красивая демка" и "можно доверить продовый тест".
Как GPT-6 Astra прошла Portal и Factorio без специального игрового пайплайна
GPT-6 Astra - модель OpenAI, вышедшая в ограниченном превью 3 сентября 2026 года; про ее бенчмарки в кодинге и разрыв Cursor AI с OpenAI я уже разбирал отдельно. Здесь интересна другая ее часть - игровые заезды. В Portal модель управляла игрой через MCP и модифицированный SourcePauseTool: игра ставилась на паузу, агент получал скриншот, координаты игрока и угол камеры, выбирал следующее действие, после чего игра возобновлялась и выполняла его. Никакого доступа к внутреннему состоянию движка - только то, что видно на экране. Итог: 23 часа 43 минуты игрового времени, около 3300 вызовов инструментов, стоимость по токенам - от 571 доллара по прайсу API.
В Factorio: Space Age Astra за 10 часов дошла до запуска ракеты, а синие научные пакеты собрала уже за первые 2 часа. Для сравнения: предыдущие модели OpenAI и Anthropic - GPT-5.6 Luna и Fable 5.1 - застряли на ранних этапах и до этой стадии в принципе не дошли.
| Игра | Результат Astra | Для сравнения |
|---|---|---|
| Portal | Пройдена за 23 ч 43 мин, ~3300 вызовов инструментов, от $571 в токенах | - |
| Factorio: Space Age | Ракета запущена за ~10 ч, синие пакеты за ~2 ч | GPT-5.6 Luna и Fable 5.1 не прошли ранние этапы |
| Pokemon FireRed | Игра пройдена за 18 ч 12 мин | GPT-5.6 Sol - 96+ ч, GPT-5.5 не закончила и за 218+ ч |
| Minecraft | 141 час, полуавтоматическая ферма blaze, потеря ресурсов от взрыва крипера | Voyager (2023) работал через структурированные данные Mineflayer API |
В Minecraft источник прямо подчеркивает механику: запуск шел через "general computer use, meaning screen, mouse, and keyboard, with no specialized game hookup" - то есть без специального игрового хука. Это принципиально отличается от проекта Voyager 2023 года, которому для игры в тот же Minecraft требовались структурированные данные через API Mineflayer, а не картинка на экране. Разница на пальцах: Voyager читал игру как программист читает базу данных, Astra смотрит на игру как игрок смотрит в монитор.
Что такое computer use и почему это не только про игры
Computer use - это режим работы модели, при котором она управляет компьютером так же, как человек: смотрит на скриншоты, двигает курсор, кликает и печатает, без специального API под конкретную программу или игру. Игры в этом смысле - просто удобный полигон: правила известны, прогресс легко измерить, а среда не меняется под агента специально.
Для обычного софта есть отдельный бенчмарк - OSWorld 2.0: 108 долгих задач в семи профессиональных доменах (research, creative production, engineering, personal services, business and finance, administration, healthcare), каждая обычно требует больше часа человеческой работы в реальном, а не игрушечном интерфейсе. Astra набрала на нем 72.6% против 65.7% у предыдущей модели GPT-5.6 Sol, а на решение задачи стала тратить около 40 минут против 75 у предшественницы. На ScreenSpot-Pro - бенчмарке, который проверяет, попадает ли модель кликом именно в нужный элемент интерфейса, - Astra выдала 92.7% против 76.9% у Sol.
Локальные модели для этой же задачи - тоже не фантастика, я недавно разбирал CUA-S1 для быстрых кликов по формам: 706 тысяч параметров, миллисекунды на решение прямо на своем железе, без похода в облако. Именно там я писал, что у меня свой парк агентов гоняет Playwright и упирается именно в задержку между решением "куда кликнуть" и самим кликом - и рост точности у Astra на ScreenSpot-Pro бьет ровно в эту же боль, просто с другой стороны: не скорость решения, а его правильность с первого раза.
Сколько реально стоит гонять computer use агента
Красивые рекорды в играх маскируют скучный вопрос: а сколько это стоит на постоянной основе, а не один раз для пресс-релиза. Прохождение Portal встало минимум в 571 доллар по прайсу API Astra - и это за одну игру, пройденную один раз, без повторных прогонов после каждого патча. Для сравнения по цене инструментальной работы: на Terminal-Bench Science 0.1 Astra набрала 64.6% против 52.6% у Claude Fable 5.1, но при этом ее оценочная стоимость API оказалась примерно на 31% ниже, чем у конкурента, - то есть на не игровых, инженерных задачах разрыв в деньгах меньше и выгоднее, чем можно подумать по цене одной эффектной демки с видеоигрой.
Для непрерывного QA это разница принципиальная. Разовый прогон "пройти Portal за $571" - это витрина возможностей, а не то, что можно вешать на каждый коммит в CI. А вот исследовательский прогон интерфейса раз в ночь или перед релизом, где не нужно 3300 вызовов инструментов подряд, а хватает нескольких десятков кликов по конкретному флоу, - совсем другая экономика: те же 5-10 минут ожидания на PR из предыдущего раздела укладываются в бюджет, который никто не назовет заоблачным.
Что прогресс computer use значит для агентов, которые работают не с играми
OpenAI прямо продает эту способность не как игровой аттракцион, а как замену интеграций: вместо того чтобы городить API под каждый корпоративный сервис, агент с computer use открывает обычный интерфейс программы и работает в нем руками - кликает, заполняет поля, читает то, что видит на экране. Это снимает необходимость писать и поддерживать десятки кастомных коннекторов под софт, у которого никакого API может и не быть вовсе - только веб-морда или десктопное приложение из девяностых.
Обратная сторона того же прогресса - тестирование интерфейсов. Практики QA-автоматизации уже фиксируют рабочий паттерн: computer use-агент берет на себя не всю проверку, а конкретный слой - исследовательские прогоны и дымовые тесты. Детерминированные регрессионные проверки по-прежнему держат Playwright и Cypress на каждый коммит, а AI-тестер встает рядом и закрывает то, что раньше делали руками перед релизом: по оценке из практики, ожидание ответа от AI-тестера на PR - 5-10 минут против примерно 15 минут ручной проверки. Ключевое ограничение оттуда же: результат AI-тестера - это сигнал для человека, а не автоматический зеленый свет для CI.
Стоит ли ждать, что агент скоро сам протестирует интерфейс продукта
Ждать не нужно - оно уже работает, просто не как полная замена QA, а как дополнительная пара глаз. У меня самого QA Telegram mini-app для DnD-бота частично лежит на двух AI-агентах на Claude: они заходят под настоящими телеграм-аккаунтами, играют как живые игроки и сами собирают логи и скрины. За два дня такой прогон дал 7 циклов тестировок - руками я столько не вывожу физически, не то что за пару суток.
Важная деталь, которую легко упустить за красивыми цифрами Astra: и мой стенд, и прогоны OpenAI по OSWorld 2.0 упираются в одну и ту же стену на длинных сценариях. У Astra на OSWorld 2.0 фиксируют три повторяющихся паттерна отказа: бинарное завершение задачи проседает быстрее, чем растет ее длина, агент теряет нить решений внутри длинной сессии, а рост точности требует непропорционально больше вызовов инструментов. На практике это значит одно: чем длиннее и запутаннее сценарий, тем выше шанс, что агент честно дойдет до середины и тихо собьется - тестировщику-человеку рядом пока лучше быть, а не спать спокойно.
Мой критерий простой: агенту на computer use можно доверить исследовательский прогон и дымовой тест - там, где нужен широкий охват и не критична стопроцентная точность каждого клика. Детерминированный регресс перед релизом - все еще задача для Playwright и человека, который читает финальный отчет, а не для модели, которая прошла Portal за $571 и один раз потеряла инвентарь в Minecraft от взрыва крипера.
Portal и Factorio тут - не спортивный рекорд ради рекорда. Тот же самый навык - смотреть на экран и действовать мышкой с клавиатурой - стал достаточно надежным, чтобы закрывать реальные, скучные, длинные задачи в обычном софте. Я слежу за такими новостями с прицелом на свой собственный конвейер тестов, рекорды в видеоиграх сами по себе меня не греют.
Частые вопросы
Что такое computer use у GPT-6 Astra?
Computer use - режим, в котором модель управляет компьютером как человек: смотрит на скриншоты экрана, двигает мышью и печатает на клавиатуре, без специального API конкретной программы или игры.
Сколько стоило прохождение Portal нейросетью GPT-6 Astra?
Прохождение Portal обошлось минимум в 571 доллар по токенам API и заняло 23 часа 43 минуты - около 3300 вызовов инструментов, без участия человека после старта.
Может ли ИИ-агент уже сам тестировать интерфейс приложения?
Частично да: AI-тестер на базе computer use берёт на себя исследовательские и дымовые проверки за 5-10 минут вместо ручных 15, но не заменяет детерминированные E2E-тесты вроде Playwright.
Как готовился материал: черновик собран моим AI-конвейером по темам и заметкам из практики, факты сверены с первоисточниками, финальный текст я прочитал, поправил и утвердил перед публикацией. Обложку к статье тоже рисует нейросеть. Про сам конвейер — в разделе обо мне.
