Все новости

ApprenticeBench: способен ли AI-агент освоить новую работу?

NeoCognition проверила, способны ли AI-агенты учиться новой должности на длинной серии рабочих задач.

AI-агент осваивает работу в бухгалтерском отделе
ApprenticeBench от NeoCognition

ApprenticeBench от NeoCognition проверяет, способен ли AI-агент освоить новую должность и работать на длинной дистанции, а не только выполнить одну задачу.

Как устроен тест

Агента принимают в виртуальную строительную компанию на работу с кредиторской задолженностью. Ему выдают архив счетов за полгода, внутренний справочник и руководство по ERP. В первый месяц он получает подробную обратную связь, затем — редкие замечания по итогам месяца. Всего в тесте 100 задач, проверенных профессиональными бухгалтерами строительной отрасли.

Результаты

По данным NeoCognition, Fable 5.1 выполнила 72 процентов задач, GPT-6 Astra — 68 процентов, а лучший из двух тестировщиков-людей — 51 процент. Большинство других моделей остались на уровне 20–25 процентов или ниже.

Слабые модели почти не обращались к архиву счетов и собственным заметкам, а к концу серии деградировали.

Что даёт обучение

Fable 5 без истории и обратной связи решила 11 задач из 100. С архивом результат вырос до 31, с обратной связью руководителя — до 35, а с обоими каналами — до 43.

Наличие памяти ещё не означает способность учиться. Агент должен понимать, когда вернуться к данным, как превратить комментарий руководителя в правило и как сохранить улучшение.

Почему это важно

ApprenticeBench ближе к реальному вопросу внедрения, чем обычный тест одной задачи. Компании нужен агент, который умеет усваивать контекст, использовать историю, не повторять ошибки и оставаться стабильным на длинной серии задач.

Источник: официальный разбор NeoCognition ApprenticeBench.

Все новости

Новости
Консультант EzraTech