כל החדשות

GPT‑6 Astra: תוצאות שיא, אוטונומיה ומחיר הטעויות

OpenAI הציגה את GPT‑6 Astra עם תוצאות מרשימות במתמטיקה, תכנות, שימוש במחשב וסייבר — אבל המספרים דורשים הקשר.

הדמיה מופשטת של GPT‑6 Astra בסגנון טכנולוגי
תמונה: OpenAI

OpenAI הציגה את GPT‑6 Astra, מודל הדגל החדש שלה למשימות reasoning, תכנות, שימוש במחשב, מחקר ועבודה מקצועית.

לפי ההשוואה שפרסמה החברה, Astra הגיעה ל־97.6% ב־FrontierMath Tier 4 v2, ל־96.0% ב־GPQA Diamond, ל־95.9% ב־BenchCAD ול־74.1% ב־DeepSWE v1.1. ב־ExploitBench היא קיבלה 100%.

אבל אי אפשר לקרוא את הטבלה הזו כמו דירוג אוניברסלי. חלק מהבדיקות הורצו ברמת reasoning effort מקסימלית, ובכמה מבדיקות הסייבר נעשה שימוש בגרסה ללא מנגנוני ההגנה הרגילים של מוצרי הייצור.

יש גם פער שחשוב לשים לב אליו: בטבלה שמופצת ברשת מופיע ציון של 98.6% ב־ARC‑AGI‑3, בעוד שבהודעה הרשמית של OpenAI מופיע ציון של 99.9%.

המשמעות הרחבה יותר מעניינת מהשאלה מי ניצח בעוד benchmark. Astra נועדה לא רק לענות על שאלות, אלא לעבוד בתוך דפדפנים, מסמכים, מערכות CRM, תוכנות הנדסיות וסביבות פיתוח.

ככל שהמודלים נעשים אוטונומיים יותר, השאלה החשובה היא לא רק כמה הם חכמים — אלא אילו פעולות אנחנו מוכנים להפקיד בידיהם, ואילו בדיקות חייבות להישאר אנושיות.

מקור: OpenAI

כל החדשות

חדשות

© 2026 EzraTech. כל הזכויות שמורות.

חדשות
יועץ EzraTech