Все новости

Anthropic представила Claude Fable 5.1 и Mythos 5.1 для долгих задач

Anthropic представила Claude Fable 5.1 и Claude Mythos 5.1, сделав акцент на кодинге, исследованиях и длительной агентной работе при более низкой расчётной стоимости.

Официальная иллюстрация Anthropic для Claude Fable 5.1 и Claude Mythos 5.1
Официальная иллюстрация из анонса Anthropic

Конкуренция переходит от коротких ответов к длительной работе

Anthropic представила Claude Fable 5.1 и Claude Mythos 5.1 — одну базовую модель с разными уровнями защитных ограничений. Fable 5.1 доступна шире, а Mythos 5.1 пока предоставляется только через программы доверенного доступа для задач в кибербезопасности и life sciences.

Главная идея анонса — не просто более качественный ответ чат-бота. Модель должна уметь долго работать над сложной задачей: исследовать, писать код, вызывать инструменты, проверять результат и исправлять ошибки.

Рост производительности и внимание к стоимости

По данным Anthropic, Fable 5.1 получила 52,6% в Terminal-Bench-Science 0.1 против 24,7% у Fable 5. Компания также сообщает о результатах в кодинге, reasoning и задачах с использованием компьютера.

Это данные самой Anthropic, поэтому их важно читать с оговорками. Стандартная ошибка научного benchmark’а составляет примерно 3,5–4,5 процентного пункта. Результат даёт полезный сигнал, но не доказывает превосходство модели в любой среде.

Anthropic оценивает снижение стоимости примерно на 25% для типичных token-based workloads и до 45% для highly agentic задач. В частности, компания снижает цену чтения ранее обработанного контекста. Фактическая экономия будет зависеть от конкретного процесса и объёма повторно используемого контекста.

Возможности не равны разрешениям

Fable 5.1 и Mythos 5.1 используют одну базовую модель, но имеют разные safeguards. Mythos рассчитана на более чувствительные сценарии и ограничена специальной программой доступа.

Anthropic отдельно отмечает, что Fable 5.1 может помогать находить уязвимости в программном обеспечении, но не предназначена для разработки эксплойтов. Более сильная модель не отменяет необходимость в разрешениях, контроле и проверке человеком.

Что здесь действительно меняется

Главная новость — не очередная таблица benchmark’ов. Конкуренция между моделями всё больше будет определяться тем, насколько надёжно они выполняют длинную цепочку работы и во сколько это обходится.

Если модель может часами работать над задачей, проверять себя и восстанавливаться после ошибок, не теряя контекст, — при меньшем потреблении ресурсов — она становится уже не экспериментом, а потенциальным рабочим инструментом.

Но для этого по-прежнему нужны независимые проверки, чёткие права доступа и контрольные точки с участием человека.

Источник: официальный анонс Anthropic

Все новости

Новости
Консультант EzraTech