Конкуренция переходит от коротких ответов к длительной работе
Anthropic представила Claude Fable 5.1 и Claude Mythos 5.1 — одну базовую модель с разными уровнями защитных ограничений. Fable 5.1 доступна шире, а Mythos 5.1 пока предоставляется только через программы доверенного доступа для задач в кибербезопасности и life sciences.
Главная идея анонса — не просто более качественный ответ чат-бота. Модель должна уметь долго работать над сложной задачей: исследовать, писать код, вызывать инструменты, проверять результат и исправлять ошибки.
Рост производительности и внимание к стоимости
По данным Anthropic, Fable 5.1 получила 52,6% в Terminal-Bench-Science 0.1 против 24,7% у Fable 5. Компания также сообщает о результатах в кодинге, reasoning и задачах с использованием компьютера.
Это данные самой Anthropic, поэтому их важно читать с оговорками. Стандартная ошибка научного benchmark’а составляет примерно 3,5–4,5 процентного пункта. Результат даёт полезный сигнал, но не доказывает превосходство модели в любой среде.
Anthropic оценивает снижение стоимости примерно на 25% для типичных token-based workloads и до 45% для highly agentic задач. В частности, компания снижает цену чтения ранее обработанного контекста. Фактическая экономия будет зависеть от конкретного процесса и объёма повторно используемого контекста.
Возможности не равны разрешениям
Fable 5.1 и Mythos 5.1 используют одну базовую модель, но имеют разные safeguards. Mythos рассчитана на более чувствительные сценарии и ограничена специальной программой доступа.
Anthropic отдельно отмечает, что Fable 5.1 может помогать находить уязвимости в программном обеспечении, но не предназначена для разработки эксплойтов. Более сильная модель не отменяет необходимость в разрешениях, контроле и проверке человеком.
Что здесь действительно меняется
Главная новость — не очередная таблица benchmark’ов. Конкуренция между моделями всё больше будет определяться тем, насколько надёжно они выполняют длинную цепочку работы и во сколько это обходится.
Если модель может часами работать над задачей, проверять себя и восстанавливаться после ошибок, не теряя контекст, — при меньшем потреблении ресурсов — она становится уже не экспериментом, а потенциальным рабочим инструментом.
Но для этого по-прежнему нужны независимые проверки, чёткие права доступа и контрольные точки с участием человека.
Источник: официальный анонс Anthropic

