OpenAI הציגה את GPT‑6 Astra, מודל הדגל החדש שלה למשימות reasoning, תכנות, שימוש במחשב, מחקר ועבודה מקצועית.
לפי ההשוואה שפרסמה החברה, Astra הגיעה ל־97.6% ב־FrontierMath Tier 4 v2, ל־96.0% ב־GPQA Diamond, ל־95.9% ב־BenchCAD ול־74.1% ב־DeepSWE v1.1. ב־ExploitBench היא קיבלה 100%.
אבל אי אפשר לקרוא את הטבלה הזו כמו דירוג אוניברסלי. חלק מהבדיקות הורצו ברמת reasoning effort מקסימלית, ובכמה מבדיקות הסייבר נעשה שימוש בגרסה ללא מנגנוני ההגנה הרגילים של מוצרי הייצור.
יש גם פער שחשוב לשים לב אליו: בטבלה שמופצת ברשת מופיע ציון של 98.6% ב־ARC‑AGI‑3, בעוד שבהודעה הרשמית של OpenAI מופיע ציון של 99.9%.
המשמעות הרחבה יותר מעניינת מהשאלה מי ניצח בעוד benchmark. Astra נועדה לא רק לענות על שאלות, אלא לעבוד בתוך דפדפנים, מסמכים, מערכות CRM, תוכנות הנדסיות וסביבות פיתוח.
ככל שהמודלים נעשים אוטונומיים יותר, השאלה החשובה היא לא רק כמה הם חכמים — אלא אילו פעולות אנחנו מוכנים להפקיד בידיהם, ואילו בדיקות חייבות להישאר אנושיות.
מקור: OpenAI

