ApprenticeBench של NeoCognition בודק אם סוכן AI מסוגל ללמוד תפקיד חדש ולעבוד לאורך סדרה ארוכה של משימות, ולא רק לפתור משימה אחת.
איך המבחן עובד
הסוכן מצטרף לחברת בנייה וירטואלית בתפקיד בתחום החשבוניות לתשלום. הוא מקבל ארכיון חשבוניות של שישה חודשים, מדריך פנימי ומסמך הדרכה למערכת ERP. בחודש הראשון הוא מקבל משוב מפורט, ובהמשך המשוב הופך נדיר יותר. המבחן כולל 100 משימות שנבדקו על ידי אנשי מקצוע בתחום החשבונאות בענף הבנייה.
התוצאות
לפי NeoCognition, Fable 5.1 השלימה 72 אחוזים מהמשימות, GPT-6 Astra השלימה 68 אחוזים, והטוב ביותר מבין שני הבודקים האנושיים הגיע ל-51 אחוזים. רוב המודלים האחרים נשארו באזור 20–25 אחוזים או פחות.
המודלים החלשים כמעט לא חזרו לארכיון או להערות שלהם, והביצועים שלהם הידרדרו לקראת סוף הסדרה.
מה מוסיפה הלמידה
ללא היסטוריה ומשוב, Fable 5 פתרה 11 מתוך 100 משימות. עם גישה לארכיון התוצאה עלתה ל-31, עם משוב מנהל ל-35, ועם שני המקורות יחד ל-43.
זיכרון אינו זהה ללמידה. סוכן צריך לדעת מתי לחזור למידע, להפוך משוב לכלל עבודה ולשמור על השיפור במשימות הבאות.
למה זה חשוב
ApprenticeBench קרוב יותר לשאלת ההטמעה האמיתית: האם סוכן מסוגל ללמוד הקשר, להשתמש בהיסטוריה, לא לחזור על טעויות ולהישאר יציב לאורך זמן?

