ApprenticeBench от NeoCognition проверяет, способен ли AI-агент освоить новую должность и работать на длинной дистанции, а не только выполнить одну задачу.
Как устроен тест
Агента принимают в виртуальную строительную компанию на работу с кредиторской задолженностью. Ему выдают архив счетов за полгода, внутренний справочник и руководство по ERP. В первый месяц он получает подробную обратную связь, затем — редкие замечания по итогам месяца. Всего в тесте 100 задач, проверенных профессиональными бухгалтерами строительной отрасли.
Результаты
По данным NeoCognition, Fable 5.1 выполнила 72 процентов задач, GPT-6 Astra — 68 процентов, а лучший из двух тестировщиков-людей — 51 процент. Большинство других моделей остались на уровне 20–25 процентов или ниже.
Слабые модели почти не обращались к архиву счетов и собственным заметкам, а к концу серии деградировали.
Что даёт обучение
Fable 5 без истории и обратной связи решила 11 задач из 100. С архивом результат вырос до 31, с обратной связью руководителя — до 35, а с обоими каналами — до 43.
Наличие памяти ещё не означает способность учиться. Агент должен понимать, когда вернуться к данным, как превратить комментарий руководителя в правило и как сохранить улучшение.
Почему это важно
ApprenticeBench ближе к реальному вопросу внедрения, чем обычный тест одной задачи. Компании нужен агент, который умеет усваивать контекст, использовать историю, не повторять ошибки и оставаться стабильным на длинной серии задач.

