Перейти к содержимому

Нейросети

Google научила Gemini копировать голос по 30 секундам записи

Новые модели синтеза речи создают голоса по описанию, озвучивают диалоги часами и умеют шептать по команде. Копию чужого голоса сделают только после проверки согласия владельца.

Иллюстрация к материалу «Google научила Gemini копировать голос по 30 секундам записи» — рубрика Нейросети
Содержание3 разделов

Коротко

  • Старшая версия рассчитана на озвучку персонажей с подробной режиссурой, облегчённая Lite нужна там, где много текста, например в дубляже.
  • Поддерживается свыше сотни языков с местными говорами, а готовых тембров в каталоге больше двух тысяч.
  • Для копии своего голоса хватает полуминутного образца, но сначала сервис убеждается, что владелец голоса согласен.
  • На каждую сгенерированную запись ставится скрытая метка SynthID, плюс в файл пишутся сведения C2PA о происхождении.

У Google появилась пара нейросетей для озвучки текста. Старшая называется Gemini 3.8 Flash TTS, упрощённая носит приставку Lite. Прежде в подобных сервисах приходилось листать список дикторов. Здесь тембр достаточно описать словами, а можно и сконструировать собственный. Пригодится это студиям, которые делают игры, авторам аудиокниг, подкастов, командам голосовых помощников.

Как нейросеть Gemini создаёт голос по текстовому описанию

Вы просто пишете, кто говорит, с каким выговором и в какой манере, а нейросеть подстраивается. Всего поддерживается более ста языков с их местными вариантами. Для тех, кто не хочет формулировать, есть каталог примерно на две тысячи дикторов, включая экзотику вроде французского из Квебека и английского с шотландским выговором.

Режиссировать можно каждую фразу отдельно. Попросить говорить медленнее, почти шептать, вставить вздох, короткий смешок или междометие. Google уверяет, что тембр не «плывёт» даже на многочасовых записях. Есть и режим разговора: из общего сценария модель сама разводит реплики двух героев по ролям и не путает, кто говорит.

Клонирование голоса за 30 секунд и защита от подделок

Самая спорная функция, конечно, копирование голоса по записи длиной в полминуты. По правилам Google, клонировать разрешено только себя или человека, который на это согласился, и прежде чем сделать копию, сервис это согласие проверяет. Готовые записи получают скрытую метку SynthID, в файл вдобавок пишутся сведения C2PA: по ним видно, что звук синтезирован.

Обольщаться не стоит. Сведения о происхождении пропадают, если файл пересохранить или записать звук с экрана, а скрытую метку увидит только тот, у кого есть программа для её поиска. Мошенники пользуются собственными моделями и никакого согласия спрашивать не будут. Так что главное правило прежнее: голосовое с просьбой перевести деньги сначала проверяем звонком. Признаки подделки и порядок действий, если «звонит родственник», собраны в нашем разборе про дипфейки.

Где попробовать озвучку Gemini и как она звучит по-русски

Попробовать обе новинки можно прямо сейчас в Google AI Studio, там для этого сделали редактор сценариев озвучки, а разработчики подключают их через API. Поддержку новинок уже пообещали четыре платформы для голосовых приложений, среди них LiveKit и Vercel.

Google приводит результаты чужих тестов. В рейтинге Hume AI по созданию голосов старшая модель набрала 71,4 и вышла на первую строчку. В сводном индексе качества того же разработчика две новинки заняли верхние позиции. Зато русский не попал в перечень языков, на которых модели лучше всего выступили вслепую в Voice Arena. Проверять русскую озвучку придётся самостоятельно, и лучше на длинном тексте: пару фраз сегодня прилично читают почти все синтезаторы.

Вы бы стали озвучивать свои видео синтезированным голосом, если бы его было не отличить от вашего?

Источники

Птичка messgo спрашивает, как вам материал

Как вам материал?

Поделиться

Читайте также

Комментарии

Написать комментарий

Без регистрации: имя и почта не нужны, мы подпишем вас случайным именем. Комментарий появится после проверки редакцией.