ElevenLabs представила Eleven v4 — новую Text-to-Speech-модель, которая должна читать сценарии почти как актёр: понимать, кто говорит, что произошло до реплики и как она должна прозвучать.
Управление прямо в сценарии
В текст можно добавлять инструкции вроде [laughs], [whispers], [pause] и звуковые события. Компания заявляет поддержку более 90 языков, нескольких спикеров и звуковых сцен.
Стабильность длинных проектов
Context stitching призван сохранять темп и подачу в длинных форматах, включая аудиокниги. Отдельную реплику можно перегенерировать без заметного «уплывания» голоса.
Для голосовых агентов
Eleven v4 Turbo рассчитана на разговоры в реальном времени: медианная задержка inference около 100 миллисекунд, а начало речи — примерно через 150 миллисекунд.
Это переход от простой озвучки текста к управляемой режиссуре голоса прямо в сценарии. При этом клонирование голоса требует ответственности: ElevenLabs указывает, что профессиональное клонирование требует подтверждённого согласия.
Источник: ElevenLabs.

