НОВОСТИ

ElevenLabs выпустила v4: 90 языков и клонирование голоса по 10 секундам записи

ElevenLabs выпустила модели v4 и v4 Turbo: клонирование голоса по десяти секундам записи, 90 языков вместо 70, сниженная задержка для голосовых агентов и расширенный набор тегов выражения.

ElevenLabs выпустила v4: 90 языков и клонирование голоса по 10 секундам записи
Содержание 3
  1. 01Что заявлено в новых моделях
  2. 02Почему это важно
  3. 03Что это значит для Беларуси

ElevenLabs выпустила две новые модели синтеза речи — v4 и v4 Turbo. Заявлены поддержка более 90 языков, клонирование голоса по десяти секундам записи и меньшая задержка, которая важна для голосовых агентов. Предыдущее поколение вышло год назад и поддерживало 70 языков.

Основное изменение внутри — новая архитектура. Она должна лучше удерживать голос на длинных текстах и учитывать смысл фразы, меняя интонацию по ходу чтения. Набор тегов для управления выражением, появившийся в прошлой версии, расширен: теги можно складывать в последовательность, и модель выполняет их по порядку.

Что заявлено в новых моделях

ПунктСодержание
Языкиболее 90 вместо 70 в прошлом поколении
Клонирование голосапо десяти секундам аудио
Выражениескладывание тегов в последовательность, учёт контекста текста
Задержканиже, чем в v3: генерация начинается вместе с ответом модели
Голосовые агентыотдельная проработка конфликтных сценариев, удержания и эскалации
Интерфейс сервиса синтеза речи на экране
Новая архитектура обещает лучше держать голос на длинных текстах и учитывать контекст при чтении

Наибольший прирост качества компания отмечает в японском, бразильском варианте португальского, а также в путунхуа и кантонском. Для голосовых агентов важнее другое: звук начинает генерироваться, как только языковая модель принимается за ответ, поэтому пауза между репликами сокращается, а разговор перестаёт напоминать общение с автоответчиком.

Почему это важно

Синтез речи превратился в конкурентную гонку. Помимо ElevenLabs, выразительные голосовые модели делают Cartesia, Deepgram, Fish Audio и другие студии, а крупные игроки вроде Google и OpenAI постоянно улучшают свои решения. Итог для пользователя простой: качество голоса перестало быть редкостью, борьба идёт за задержку, управляемость и цену.

Отдельный сюжет — деньги. По данным компании, более половины выручки приносят крупные корпоративные клиенты, а годовая выручка выросла примерно с 330 до более чем 600 миллионов долларов. Основатель компании говорит о планах выхода на биржу, не называя сроков. Это объясняет, почему новые модели выпускают так часто: рынок корпоративных голосовых сервисов растёт быстрее, чем потребительский.

Что это значит для Беларуси

Сервис работает через веб-интерфейс и API и доступен из Беларуси, но оплата требует зарубежной карты, а корпоративным клиентам стоит учитывать требования к хранению данных: записи голоса — персональные данные, и передавать их в сторонний сервис без согласия людей нельзя.

Практические моменты для тех, кто думает о внедрении. Первый: определяйте сценарий заранее — для озвучки видео хватает базового тарифа, для голосового агента нужна модель с низкой задержкой. Второй: клонирование голоса сотрудника оформляйте письменным согласием, иначе рискуете получить претензию. Третий: проверяйте белорусские реалии — фамилии, названия улиц и аббревиатуры модели на русском читают с ошибками, поэтому текст под озвучку приходится готовить вручную. Четвёртый: считайте расходы по знакам, а не по минутам готового аудио, иначе бюджет уезжает втрое.

По теме: голосовые модели Gemini TTS и интерактивный цифровой аватар Synthesia.

Текст TehnoRex. Дата: 2026-09-28.

ПОДПИШИТЕСЬ НА РАССЫЛКУ

Новые обзоры и сравнения — на почту