Скидка до 55% и курс по ИИ в подарок 2 дня 10 :28 :07 Выбрать курс
Код
#новости

OpenAI представила GPT-6 Astra — новую флагманскую модель

А мы собрали всё, что о ней уже известно.

3 сентября OpenAI представила GPT-6 Astra — новую флагманскую модель для программирования, научных исследований и работы за компьютером. Компания называет её самой умной моделью в мире. Независимые испытания подтверждают рекордные результаты в решении незнакомых задач.

Astra заточена под многоэтапную работу — модель может написать код сайта, запустить его, проверить страницы в браузере и исправить ошибки. Если пользователь меняет требования, модель учитывает уточнения и продолжает работу над исходной задачей. По описанию OpenAI, она лучше сохраняет цель длительного проекта и принимает самостоятельные решения там, где достаточно имеющейся информации.

По результатам тестов модель значительно обгоняет конкурентов

OpenAI опубликовала результаты тестов: по всем показателям Astra обогнала предыдущую модель GPT 5.6 Sol и модели Claude.

Что проверялиGPT-6 AstraGPT-5.6 SolClaude
Fable 5.1
Claude
Opus 5
Работа с кодом и программами — Terminal-Bench 4.057,9%37,3%55,8%52,3%
Разработка ПО — DeepSWE 1.174,1%72,7%67,4%73,7%
Научные задачи — Terminal-Bench Science 0.164,6%22,4%52,6%30,0%
Сложная математика — FrontierMath Tier 4 v297,6%83,0%87,8%73,2%
Автоматизация работы — AutomationBench41,4%18,1%31,4%26,9%
Управление компьютером — OSWorld 2, автономная часть теста72,6%65,7%70,2%

В тесте ARC-AGI-3 Astra модель должна была делать ходы в незнакомой игре, наблюдать за результатом и самостоятельно выяснять правила и условия победы. При оценке учитывалось, сколько действий ей потребовалось для решения задачи.

Проверку провели двумя способами. В стандартном режиме Astra могла передавать себе на следующий ход только сами ответы. Во втором система сохраняла также внутренний ход рассуждений модели, позволяя продолжать уже начатый поиск решения.

Как модель сохраняла информацию между ходамиЛучшая оценка Astra
Использовала только составленные ею заметки62,7%
Продолжала работу с сохранённым ходом рассуждений99,9%

Грег Камрадт из ARC Prize назвал Astra лучшей моделью, которую команда когда-либо тестировала. Исследователи отдельно отметили её работу с заметками: Astra придумывала короткие обозначения для объектов и правил, записывала положение игровых элементов и составляла последовательность следующих ходов.

В сложной математике Astra заметно опережает обе модели Claude, представленные в сравнении OpenAI.

МодельFrontierMath Tier 4 v2
GPT-6 Astra97,6%
Claude Fable 5.187,8%
Claude Opus 573,2%

При этом в независимом индексе Artificial Analysis, объединяющем девять проверок разных навыков, впереди остаётся Fable 5.1. Здесь обе модели сравнивали при максимальных настройках рассуждения.

МодельИндекс Artificial Analysis, баллы
GPT-6 Astra61
Claude Fable 5.166

Что говорят первые пользователи

Автор Forward Future Мэттью Берман назвал Astra лучшей моделью из тех, которыми он пользовался. Одним из самых масштабных его заданий стала Newhaven — градостроительная игра в духе SimCity. Astra работала над ней пять дней: создала дороги, транспорт, коммунальные системы и механики роста населения. Проект ещё в разработке, но опубликованную версию уже можно запустить и поиграть.

Профессор Уортонской школы бизнеса Итан Моллик поручил Astra собрать личную базу знаний из десятков тысяч писем, собственных текстов и записей календаря. Модель должна была связать сведения о его исследованиях, контактах, идеях и задачах. По словам Моллика, она самостоятельно выбрала подход, загрузила необходимые программы и за пять суток работы создала персональную вики объёмом в несколько гигабайт. Теперь Astra дважды в день сопоставляет новые письма с накопленными сведениями.

В другом испытании Моллик попросил модель провести оригинальные исследования предпринимательства: найти открытые данные и заранее зарегистрировать гипотезы, которые она собирается проверять. Получились хорошо оформленные и, по его оценке, технически корректные статьи. При этом выбранные темы он счёл скучными. По его мнению, Astra уже справляется со значительной частью исследовательской работы, но выбор интересного научного вопроса остаётся её слабым местом.

Команда Latent Space проверила Astra на разработке нескольких собственных проектов. Один из них — Forge, сервис для хранения исходного кода, сборки, тестирования и публикации сайтов. Авторы описывают его как работающий, хотя ещё незавершённый продукт. С помощью Astra они также обучали компьютерных противников для трёхмерной стратегии OverGrid.

Для этой работы команда использовала систему, в которой главный агент управлял 20–50 помощниками. Агенты подбирали и обучали модели, следили за запусками, разбирали ошибки и перезапускали процессы после исправлений. Авторы считают, что Astra уже способна брать на себя обязанности инженера по ИИ и вести такую работу на протяжении длительного времени. Их результаты получены с собственной системой инструментов и координации агентов; OpenAI предоставила команде расширенные лимиты для тестирования.

Когда откроют доступы

Доступ к новой модели выдают постепенно. OpenAI планирует в течение недели открыть Astra подписчикам Plus, Pro, Business и Enterprise, а также разработчикам через API.

На тарифе Plus пользователи получат Astra в режимах Work и Codex. В обычном чате она будет доступна подписчикам тарифа Pro и выше.

Больше интересного про код — в нашем телеграм-канале.  Подписывайтесь!

Освойте 45+ топовых нейросетей в одном курсе
На курсе Skillbox вы на практике изучите ИИ-инструменты. Сможете делать за минуты то, на что раньше уходили часы.
Узнать о курсе

Курсы по нейросетям
Читаете про нейросети?
Освойте их на уровне эксперта. По клику — 22 курса по ИИ под разные задачи и бюджет.
Смотреть курсы
Понравилась статья?
Да

Пользуясь нашим сайтом, вы соглашаетесь с тем, что мы используем cookies 🍪

Ссылка скопирована