Eleven v4: что изменилось в озвучке ElevenLabs и как управлять эмоциями
28 сентября 2026 года ElevenLabs представила Eleven v4 и Eleven v4 Turbo. Обе модели превращают текст в речь, но рассчитаны на разные задачи: v4 предназначена для выразительной озвучки, а Turbo — для интерактивных приложений и голосовых агентов. Главное обещание обновления — более точная передача эмоций и устойчивый голос при работе с длинными сценами и диалогами. Это заявления разработчика; качество на ваших текстах стоит проверять отдельно. Модели и ограничения, changelog.
Что нового в Eleven v4
В анонсе ElevenLabs выделяет работу с контекстом, темпом и характером реплик. Модель должна лучше сохранять узнаваемость говорящего при повторной генерации и переходах между фрагментами. Добавлена поддержка Professional Voice Clones, а соединение отдельных генераций в длинную запись стало надёжнее, по оценке компании. Эти изменения особенно интересны авторам аудиокниг, видеороликов и игровых диалогов: именно на стыках реплик часто становится заметна неоднородность синтетической речи. Анонс ElevenLabs.
В документации для семейства v4 указана поддержка более 90 языков. Для обычной v4 заявлен лимит 10 000 символов и работа с диалогами нескольких говорящих. Это технические возможности сервиса, а не обещание одинакового произношения и выразительности на каждом языке. Перед большой серией роликов полезно проверить имена, ударения, числа и профессиональные термины на языке будущей публикации. Документация моделей.
Audio Tags: как задавать эмоции в озвучке
Audio Tags — короткие указания в квадратных скобках внутри сценария. Например, [whispers] задаёт шёпот, а [excited] помогает обозначить воодушевлённую подачу. Тег ставят перед фразой, которую нужно произнести соответствующим образом. По руководству ElevenLabs, направление сохраняется дальше по реплике, пока вы не зададите другое. Можно объединять характеристики, например [whispering, playful]. Руководство Audio Tags.
Жёсткого полного списка команд нет: сервис поддерживает описания подачи обычными словами. Но из этого не следует, что любая формулировка всегда сработает одинаково. Начните с одного понятного указания, прослушайте результат и только потом добавляйте уточнения. Если одновременно попросить несколько противоположных эмоций, будет сложнее понять, какая часть инструкции повлияла на голос.
Для первого теста подойдёт короткая реплика: «[excited] Новая коллекция уже здесь. [whispers] А этот вариант мы оставили для самых внимательных». Это пример сценария для эксперимента, не готовая запись: её звучание зависит от выбранного голоса и генерации. Сравните вариант с тегами и без них на одном и том же тексте.
ElevenLabs отдельно поясняет, что ставить тег в каждой строке необязательно: v4 умеет выводить эмоциональную подачу из контекста. Указания полезнее там, где интонация должна заметно измениться. На ритм также влияют пунктуация и длина предложений. Поэтому сначала стоит привести сценарий в порядок, а затем управлять его исполнением. Практика эмоциональной озвучки.
Чем Eleven v4 Turbo отличается от v4
Turbo ориентирована на сценарии, где ответ должен прозвучать быстро. Компания указывает медианную задержку вычисления около 100 мс. В том же анонсе встречается другая метрика — около 150 мс до первой слышимой речи в сравнительном тесте. Эти показатели измеряют разные этапы и не означают, что полноценный голосовой помощник всегда отвечает за десятую долю секунды. Анонс ElevenLabs.
Документация уточняет, что задержка модели не включает работу приложения и сети. В реальном помощнике время добавляют распознавание речи, подготовка ответа и вызовы внешних инструментов. Поэтому выбирать Turbo только по одному числу из анонса недостаточно. Для ролика важнее качество итоговой дорожки; для диалога — вся пауза между вопросом человека и началом ответа. Документация моделей.
Разработчикам важно проверить интерфейс интеграции: в changelog от 28 сентября для eleven_v4 указан Text to Dialogue API, для eleven_v4_turbo — Text to Dialogue WebSocket. Наличие новой модели не означает, что её идентификатор можно без изменений подставить в любой старый запрос. Changelog ElevenLabs.
Как проверить модель перед рабочим проектом
Соберите небольшой набор фрагментов: нейтральное объяснение, эмоциональную реплику, диалог двух персонажей и абзац со сложными именами. Для каждого сохраните текст, голос и настройки. Затем оценивайте не только красоту звучания, но и пропуски слов, ударения, лишние звуки и возможность повторить удачную подачу.
Если задача связана с клонированием, используйте собственный голос либо запись, на использование которой есть разрешение. Для коммерческого проекта отдельно проверьте условия выбранного тарифа, права на исходные материалы и стоимость повторных генераций. Бесплатная регистрация сама по себе не описывает все ограничения использования.
По сообщению ElevenLabs, обе модели доступны в ElevenCreative, ElevenAgents и через ElevenAPI. Обновление стоит протестировать, если вам нужны управляемые эмоции или естественные диалоги. Решение о переходе лучше принимать после сравнения на собственном сценарии: рекламные демонстрации помогают увидеть возможности, но не заменяют проверку готовой озвучки. Официальный анонс.