ElevenLabs выпустила две новые модели синтеза речи — v4 и v4 Turbo. Заявлены поддержка более 90 языков, клонирование голоса по десяти секундам записи и меньшая задержка, которая важна для голосовых агентов. Предыдущее поколение вышло год назад и поддерживало 70 языков.
Основное изменение внутри — новая архитектура. Она должна лучше удерживать голос на длинных текстах и учитывать смысл фразы, меняя интонацию по ходу чтения. Набор тегов для управления выражением, появившийся в прошлой версии, расширен: теги можно складывать в последовательность, и модель выполняет их по порядку.
Что заявлено в новых моделях
| Пункт | Содержание |
|---|---|
| Языки | более 90 вместо 70 в прошлом поколении |
| Клонирование голоса | по десяти секундам аудио |
| Выражение | складывание тегов в последовательность, учёт контекста текста |
| Задержка | ниже, чем в v3: генерация начинается вместе с ответом модели |
| Голосовые агенты | отдельная проработка конфликтных сценариев, удержания и эскалации |

Наибольший прирост качества компания отмечает в японском, бразильском варианте португальского, а также в путунхуа и кантонском. Для голосовых агентов важнее другое: звук начинает генерироваться, как только языковая модель принимается за ответ, поэтому пауза между репликами сокращается, а разговор перестаёт напоминать общение с автоответчиком.
Почему это важно
Синтез речи превратился в конкурентную гонку. Помимо ElevenLabs, выразительные голосовые модели делают Cartesia, Deepgram, Fish Audio и другие студии, а крупные игроки вроде Google и OpenAI постоянно улучшают свои решения. Итог для пользователя простой: качество голоса перестало быть редкостью, борьба идёт за задержку, управляемость и цену.
Отдельный сюжет — деньги. По данным компании, более половины выручки приносят крупные корпоративные клиенты, а годовая выручка выросла примерно с 330 до более чем 600 миллионов долларов. Основатель компании говорит о планах выхода на биржу, не называя сроков. Это объясняет, почему новые модели выпускают так часто: рынок корпоративных голосовых сервисов растёт быстрее, чем потребительский.
Что это значит для Беларуси
Сервис работает через веб-интерфейс и API и доступен из Беларуси, но оплата требует зарубежной карты, а корпоративным клиентам стоит учитывать требования к хранению данных: записи голоса — персональные данные, и передавать их в сторонний сервис без согласия людей нельзя.
Практические моменты для тех, кто думает о внедрении. Первый: определяйте сценарий заранее — для озвучки видео хватает базового тарифа, для голосового агента нужна модель с низкой задержкой. Второй: клонирование голоса сотрудника оформляйте письменным согласием, иначе рискуете получить претензию. Третий: проверяйте белорусские реалии — фамилии, названия улиц и аббревиатуры модели на русском читают с ошибками, поэтому текст под озвучку приходится готовить вручную. Четвёртый: считайте расходы по знакам, а не по минутам готового аудио, иначе бюджет уезжает втрое.
По теме: голосовые модели Gemini TTS и интерактивный цифровой аватар Synthesia.
Текст TehnoRex. Дата: 2026-09-28.



