
Содержание3 разделов
Коротко
- Старшая версия рассчитана на озвучку персонажей с подробной режиссурой, облегчённая Lite нужна там, где много текста, например в дубляже.
- Поддерживается свыше сотни языков с местными говорами, а готовых тембров в каталоге больше двух тысяч.
- Для копии своего голоса хватает полуминутного образца, но сначала сервис убеждается, что владелец голоса согласен.
- На каждую сгенерированную запись ставится скрытая метка SynthID, плюс в файл пишутся сведения C2PA о происхождении.
У Google появилась пара нейросетей для озвучки текста. Старшая называется Gemini 3.8 Flash TTS, упрощённая носит приставку Lite. Прежде в подобных сервисах приходилось листать список дикторов. Здесь тембр достаточно описать словами, а можно и сконструировать собственный. Пригодится это студиям, которые делают игры, авторам аудиокниг, подкастов, командам голосовых помощников.
Как нейросеть Gemini создаёт голос по текстовому описанию
Вы просто пишете, кто говорит, с каким выговором и в какой манере, а нейросеть подстраивается. Всего поддерживается более ста языков с их местными вариантами. Для тех, кто не хочет формулировать, есть каталог примерно на две тысячи дикторов, включая экзотику вроде французского из Квебека и английского с шотландским выговором.
Режиссировать можно каждую фразу отдельно. Попросить говорить медленнее, почти шептать, вставить вздох, короткий смешок или междометие. Google уверяет, что тембр не «плывёт» даже на многочасовых записях. Есть и режим разговора: из общего сценария модель сама разводит реплики двух героев по ролям и не путает, кто говорит.
Клонирование голоса за 30 секунд и защита от подделок
Самая спорная функция, конечно, копирование голоса по записи длиной в полминуты. По правилам Google, клонировать разрешено только себя или человека, который на это согласился, и прежде чем сделать копию, сервис это согласие проверяет. Готовые записи получают скрытую метку SynthID, в файл вдобавок пишутся сведения C2PA: по ним видно, что звук синтезирован.
Обольщаться не стоит. Сведения о происхождении пропадают, если файл пересохранить или записать звук с экрана, а скрытую метку увидит только тот, у кого есть программа для её поиска. Мошенники пользуются собственными моделями и никакого согласия спрашивать не будут. Так что главное правило прежнее: голосовое с просьбой перевести деньги сначала проверяем звонком. Признаки подделки и порядок действий, если «звонит родственник», собраны в нашем разборе про дипфейки.
Где попробовать озвучку Gemini и как она звучит по-русски
Попробовать обе новинки можно прямо сейчас в Google AI Studio, там для этого сделали редактор сценариев озвучки, а разработчики подключают их через API. Поддержку новинок уже пообещали четыре платформы для голосовых приложений, среди них LiveKit и Vercel.
Google приводит результаты чужих тестов. В рейтинге Hume AI по созданию голосов старшая модель набрала 71,4 и вышла на первую строчку. В сводном индексе качества того же разработчика две новинки заняли верхние позиции. Зато русский не попал в перечень языков, на которых модели лучше всего выступили вслепую в Voice Arena. Проверять русскую озвучку придётся самостоятельно, и лучше на длинном тексте: пару фраз сегодня прилично читают почти все синтезаторы.
Вы бы стали озвучивать свои видео синтезированным голосом, если бы его было не отличить от вашего?
Источники

Как вам материал?



Комментарии