Z.ai представила GLM-5.3-Flash — новую мультимодальную модель семейства GLM-5 для программирования, AI-агентов и работы с длинным контекстом.
320 млрд параметров, но только 18 млрд активных
По данным Z.ai, модель содержит 320 млрд параметров, из которых примерно 18 млрд активируются на каждом шаге. GLM-5.3-Flash принимает текст, изображения и видео, а контекстное окно достигает 1 млн токенов.
В архитектуре объединены sparse attention и linear attention. Также Z.ai представила IndexPool — механизм для снижения стоимости обработки длинного контекста.
Заявленные результаты
- 63,4 против 46,2 у GLM-5.2 в DeepSWE v1.1;
- 48,8 против 26,2 в AutomationBench;
- 29,0 против 29,5 у Claude Opus 4.8 во внутреннем Z.ai Code Bench;
- в 3 раза меньше attention compute и в 4,4 раза меньше KV cache по сравнению с GLM-5.3.
Эти показатели опубликованы самой Z.ai. До появления независимых проверок их следует считать заявленными результатами производителя.
Почему это важно
GLM-5.3-Flash показывает, что эффективность модели становится не менее важной, чем её максимальная способность рассуждать. Для AI-агентов стоимость длинных сессий, документов и мультимодальных данных напрямую влияет на возможность внедрения.
Z.ai сообщает, что модель работала на китайской AI-инфраструктуре и выпущена под лицензией MIT. Веса доступны через Hugging Face.
Источник: официальный блог Z.ai.

