OpenAI представила GPT‑6 Astra — новую флагманскую модель для reasoning, программирования, работы с компьютером, исследований и профессиональных задач.
В опубликованном компанией сравнении Astra получила 97,6% на FrontierMath Tier 4 v2, 96,0% на GPQA Diamond, 95,9% на BenchCAD и 74,1% на DeepSWE v1.1. На ExploitBench результат составил 100%.
Эти цифры нельзя воспринимать как универсальный рейтинг. Часть тестов проводилась с максимальным уровнем reasoning effort, а некоторые кибербезопасностные оценки — без стандартных production safeguards.
Есть и важная деталь: в распространяемой таблице для ARC‑AGI‑3 указано 98,6%, тогда как в официальном релизе OpenAI — 99,9%.
Более интересен общий сдвиг: Astra должна не только отвечать на вопросы, но и работать в браузерах, документах, CRM, инженерных программах и средах разработки.
По мере роста автономности моделей главный вопрос звучит уже не только как «насколько они умны?», а как «какие действия мы готовы им доверить — и какие проверки должны оставаться за человеком?»
Источник: OpenAI

