3 сентября OpenAI представила GPT-6 Astra — новую флагманскую модель для программирования, научных исследований и работы за компьютером. Компания называет её самой умной моделью в мире. Независимые испытания подтверждают рекордные результаты в решении незнакомых задач.
Astra заточена под многоэтапную работу — модель может написать код сайта, запустить его, проверить страницы в браузере и исправить ошибки. Если пользователь меняет требования, модель учитывает уточнения и продолжает работу над исходной задачей. По описанию OpenAI, она лучше сохраняет цель длительного проекта и принимает самостоятельные решения там, где достаточно имеющейся информации.
По результатам тестов модель значительно обгоняет конкурентов
OpenAI опубликовала результаты тестов: по всем показателям Astra обогнала предыдущую модель GPT 5.6 Sol и модели Claude.
| Что проверяли | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 | Claude Opus 5 |
|---|---|---|---|---|
| Работа с кодом и программами — Terminal-Bench 4.0 | 57,9% | 37,3% | 55,8% | 52,3% |
| Разработка ПО — DeepSWE 1.1 | 74,1% | 72,7% | 67,4% | 73,7% |
| Научные задачи — Terminal-Bench Science 0.1 | 64,6% | 22,4% | 52,6% | 30,0% |
| Сложная математика — FrontierMath Tier 4 v2 | 97,6% | 83,0% | 87,8% | 73,2% |
| Автоматизация работы — AutomationBench | 41,4% | 18,1% | 31,4% | 26,9% |
| Управление компьютером — OSWorld 2, автономная часть теста | 72,6% | 65,7% | — | 70,2% |
В тесте ARC-AGI-3 Astra модель должна была делать ходы в незнакомой игре, наблюдать за результатом и самостоятельно выяснять правила и условия победы. При оценке учитывалось, сколько действий ей потребовалось для решения задачи.
Проверку провели двумя способами. В стандартном режиме Astra могла передавать себе на следующий ход только сами ответы. Во втором система сохраняла также внутренний ход рассуждений модели, позволяя продолжать уже начатый поиск решения.
| Как модель сохраняла информацию между ходами | Лучшая оценка Astra |
|---|---|
| Использовала только составленные ею заметки | 62,7% |
| Продолжала работу с сохранённым ходом рассуждений | 99,9% |
Грег Камрадт из ARC Prize назвал Astra лучшей моделью, которую команда когда-либо тестировала. Исследователи отдельно отметили её работу с заметками: Astra придумывала короткие обозначения для объектов и правил, записывала положение игровых элементов и составляла последовательность следующих ходов.
В сложной математике Astra заметно опережает обе модели Claude, представленные в сравнении OpenAI.
| Модель | FrontierMath Tier 4 v2 |
|---|---|
| GPT-6 Astra | 97,6% |
| Claude Fable 5.1 | 87,8% |
| Claude Opus 5 | 73,2% |
При этом в независимом индексе Artificial Analysis, объединяющем девять проверок разных навыков, впереди остаётся Fable 5.1. Здесь обе модели сравнивали при максимальных настройках рассуждения.
| Модель | Индекс Artificial Analysis, баллы |
|---|---|
| GPT-6 Astra | 61 |
| Claude Fable 5.1 | 66 |
Что говорят первые пользователи
Автор Forward Future Мэттью Берман назвал Astra лучшей моделью из тех, которыми он пользовался. Одним из самых масштабных его заданий стала Newhaven — градостроительная игра в духе SimCity. Astra работала над ней пять дней: создала дороги, транспорт, коммунальные системы и механики роста населения. Проект ещё в разработке, но опубликованную версию уже можно запустить и поиграть.
Профессор Уортонской школы бизнеса Итан Моллик поручил Astra собрать личную базу знаний из десятков тысяч писем, собственных текстов и записей календаря. Модель должна была связать сведения о его исследованиях, контактах, идеях и задачах. По словам Моллика, она самостоятельно выбрала подход, загрузила необходимые программы и за пять суток работы создала персональную вики объёмом в несколько гигабайт. Теперь Astra дважды в день сопоставляет новые письма с накопленными сведениями.
В другом испытании Моллик попросил модель провести оригинальные исследования предпринимательства: найти открытые данные и заранее зарегистрировать гипотезы, которые она собирается проверять. Получились хорошо оформленные и, по его оценке, технически корректные статьи. При этом выбранные темы он счёл скучными. По его мнению, Astra уже справляется со значительной частью исследовательской работы, но выбор интересного научного вопроса остаётся её слабым местом.
Команда Latent Space проверила Astra на разработке нескольких собственных проектов. Один из них — Forge, сервис для хранения исходного кода, сборки, тестирования и публикации сайтов. Авторы описывают его как работающий, хотя ещё незавершённый продукт. С помощью Astra они также обучали компьютерных противников для трёхмерной стратегии OverGrid.
Для этой работы команда использовала систему, в которой главный агент управлял 20–50 помощниками. Агенты подбирали и обучали модели, следили за запусками, разбирали ошибки и перезапускали процессы после исправлений. Авторы считают, что Astra уже способна брать на себя обязанности инженера по ИИ и вести такую работу на протяжении длительного времени. Их результаты получены с собственной системой инструментов и координации агентов; OpenAI предоставила команде расширенные лимиты для тестирования.
Когда откроют доступы
Доступ к новой модели выдают постепенно. OpenAI планирует в течение недели открыть Astra подписчикам Plus, Pro, Business и Enterprise, а также разработчикам через API.
На тарифе Plus пользователи получат Astra в режимах Work и Codex. В обычном чате она будет доступна подписчикам тарифа Pro и выше.
Больше интересного про код — в нашем телеграм-канале. Подписывайтесь!