Google представила Gemini 3.8 Flash TTS: ИИ создаёт новые голоса и копирует существующие по 30 секундам аудио
- AlexT
- 24-сен-2026, 10:00
- 0 комментариев
- 0 просмотров

Google расширила семейство Gemini двумя моделями для генерации речи — Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. Вместо обычного выбора диктора из нескольких заранее подготовленных вариантов разработчики получают полноценный инструмент для конструирования голоса: можно описать его словами, настроить акцент и манеру речи, а затем управлять исполнением практически каждой реплики.
Одной из наиболее заметных возможностей стало воспроизведение голоса по 30-секундному аудиообразцу. Google разрешает использовать для этого собственный голос либо голос человека, на который имеются соответствующие права. Компания предусмотрела проверку согласия, а синтезированные записи маркируются с помощью SynthID; для реплицированных голосов также используются данные C2PA. Новинки ориентированы на игры, подкасты, аудиокниги, дубляж и голосовых ИИ-ассистентов.
Gemini 3.8 Flash TTS позиционируется как более продвинутый вариант для творческих задач и детальной режиссуры. Пользователь может сформулировать желаемые характеристики естественным языком — например, определить роль персонажа, особенности произношения, акцент и общее звучание.
Система работает более чем со 100 языками и диалектами. Кроме генерации оригинальных голосов с нуля Google предлагает библиотеку из более чем 2000 готовых вариантов. В ней присутствуют в том числе региональные разновидности речи — мексиканский испанский, квебекский французский и шотландский английский.
Созданный голос можно сохранить и использовать в последующих проектах. Это должно помочь сохранять узнаваемое звучание персонажа на протяжении продолжительной работы и уменьшить нежелательное изменение тембра между генерациями.
Google также готовит функцию Voice Remixing. Она позволит взять существующий голос из библиотеки и дополнительно изменить его тембр, высоту, скорость речи или акцент при помощи текстового описания. Эта возможность заявлена как будущая и на момент анонса ещё не запущена.
Отдельный режим позволяет воссоздать голосовой профиль человека по короткому образцу продолжительностью около 30 секунд.
Google подчёркивает, что механизм предназначен для копирования собственного голоса или материала, на использование которого пользователь имеет необходимые права. Для этой возможности предусмотрена встроенная проверка согласия.
Система защиты не ограничивается одним механизмом. Сгенерированное аудио получает невидимую маркировку SynthID, позволяющую идентифицировать контент, созданный искусственным интеллектом. Для реплицированных голосов Google дополнительно заявляет использование учётных данных стандарта C2PA, предназначенных для подтверждения происхождения цифрового контента.
При этом у функции есть региональные ограничения. Google сообщает, что репликация голосов через AI Studio недоступна, в частности, в Европейской экономической зоне, Великобритании, Швейцарии, Индии, а также в американских штатах Иллинойс и Техас.
Новые модели работают не только как обычный преобразователь текста в речь. Пользователь может выступать в роли своеобразного режиссёра и задавать способ исполнения отдельных строк сценария.
С помощью текстовых инструкций можно менять эмоциональную окраску, темп и особенности произношения. Поддерживаются шёпот и различные разговорные элементы.
В сценарий разрешается включать и невербальные реакции — например, смех, вздох или удивление. Модель также умеет воспроизводить короткие реакции собеседника, благодаря чему диалог должен звучать естественнее.
Ещё одно важное направление — автоматическое создание полноценных диалоговых сцен.
Модели способны работать с двумя говорящими в рамках одного сценария. При генерации сохраняются разные голоса персонажей и естественная последовательность их реплик.
Это может оказаться особенно полезно при производстве подкастов, игровых диалогов, озвучивании историй и создании интерактивных голосовых агентов.
Предусмотрена и генерация длинных записей. По заявлению Google, система способна на протяжении нескольких часов сохранять качество речи, естественный ритм и характер выбранного голоса с минимальным отклонением его звучания.
Если обычная Gemini 3.8 Flash TTS ориентирована прежде всего на глубокую настройку персонажей и управление исполнением, то Gemini 3.8 Flash-Lite TTS рассчитана на задачи, где важны большие объёмы генерации и экономичность.
Google называет среди таких сценариев масштабный дубляж, массовое производство аудиоконтента и создание голосовых ИИ-агентов. При этом облегчённая модель также позволяет контролировать тон, темп и выразительность речи.
В опубликованных Google результатах Gemini 3.8 Flash TTS получила 71,4 балла и первое место в Voice Design Benchmark от Hume AI. В отдельном испытании моделирования акцентов результат составил 60,8 балла, что также соответствовало первой позиции.
По данным компании, Gemini 3.8 Flash TTS и Flash-Lite TTS заняли соответственно первое и второе места в Overall Quality Index от Hume AI. Эти показатели следует рассматривать именно как результаты, приведённые Google при презентации своих моделей, а не как универсальную оценку качества всех существующих систем синтеза речи.
Google также сообщает о высоких позициях моделей в слепых пользовательских сравнениях Voice Arena для ряда языков, включая японский, бразильский португальский, вьетнамский, современный стандартный арабский, мексиканский испанский и хинди.
Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS начали распространяться 23 сентября 2026 года. Разработчики могут работать с ними через Google AI Studio и Gemini API. Flash TTS также появляется в Gemini Notebook, тогда как Flash-Lite используется в Google Vids. Для корпоративных клиентов доступ через API в Gemini Enterprise заявлен на более поздний срок.
Для интеграции новых голосовых возможностей в сторонние продукты модели можно использовать через Gemini API. Google отдельно упоминает платформы Agora, LiveKit, Pipecat и Vercel среди сервисов, позволяющих разработчикам создавать на их основе голосовые приложения.
Таким образом, Google постепенно уходит от классической модели TTS, где пользователь выбирает одного из нескольких дикторов и передаёт ему текст. Gemini 3.8 превращает синтез речи в значительно более управляемый процесс: голос можно сконструировать или воспроизвести по образцу, сохранить для дальнейшей работы, отдельно режиссировать реплики и использовать одного или нескольких виртуальных исполнителей в продолжительных аудиопроектах.