Все новости

GPT‑6 Astra: рекордные результаты, автономность и цена ошибок

OpenAI представила GPT‑6 Astra с сильными результатами в математике, coding, computer use и cybersecurity — но цифрам нужен контекст.

Абстрактная технологическая визуализация GPT-6 Astra
Изображение: OpenAI

OpenAI представила GPT‑6 Astra — новую флагманскую модель для reasoning, программирования, работы с компьютером, исследований и профессиональных задач.

В опубликованном компанией сравнении Astra получила 97,6% на FrontierMath Tier 4 v2, 96,0% на GPQA Diamond, 95,9% на BenchCAD и 74,1% на DeepSWE v1.1. На ExploitBench результат составил 100%.

Эти цифры нельзя воспринимать как универсальный рейтинг. Часть тестов проводилась с максимальным уровнем reasoning effort, а некоторые кибербезопасностные оценки — без стандартных production safeguards.

Есть и важная деталь: в распространяемой таблице для ARC‑AGI‑3 указано 98,6%, тогда как в официальном релизе OpenAI — 99,9%.

Более интересен общий сдвиг: Astra должна не только отвечать на вопросы, но и работать в браузерах, документах, CRM, инженерных программах и средах разработки.

По мере роста автономности моделей главный вопрос звучит уже не только как «насколько они умны?», а как «какие действия мы готовы им доверить — и какие проверки должны оставаться за человеком?»

Источник: OpenAI

Все новости

Новости
Консультант EzraTech