Лаборатория Ai ИИ новости дня · dokulab.ru обновление ежедневно 07:30
Google DeepMind · 23 сентября 2026, 15:25

Google DeepMind представила Gemini 3.8 text-to-speech

Модели и релизы Google DeepMind выпуск от 24 сентября 2026 · первоисточник

DeepMind выпустила новую версию модели синтеза речи — Gemini 3.8 text-to-speech.

Коротко о новости

Google представила две новые модели синтеза речи — Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS, которые компания называет самыми выразительными среди своих аудиомоделей. Старшая версия ориентирована на полноценную творческую работу и создание персонажей: голоса можно генерировать с нуля с помощью обычных текстовых описаний, задавая роль, акцент и характер, а каждую реплику — направлять отдельно, управляя темпом, эмоциями и диалектными особенностями. Flash-Lite TTS предназначена для больших объёмов и экономичности: она рассчитана на массовое дублирование, создание аудиоконтента и голосовых агентов с точным контролем тона и интонаций. Обе модели продолжают линейку Gemini Audio, к которой ранее относились 3.5 Live Translate, 3.5 Transcribe, а также 3.8 Live и 3.8 Live Extended Thinking. Библиотека голосов расширена до более чем 2000 готовых вариантов с поддержкой региональных разновидностей вроде мексиканского испанского, квебекского французского и шотландского английского, а собственный голос можно воспроизвести по 30-секундному образцу. Для защиты используются проверка согласия, водяные знаки SynthID и учётные данные C2PA, при этом воспроизведение голосов через AI Studio недоступно в ряде регионов, включая Иллинойс, Техас, EEA, Великобританию, Швейцарию и Индию. Модели поддерживают длинную генерацию без заметного смещения голоса, диалоги двух собеседников из одного сценария и естественные звуки вроде смеха и вздохов, а доступны они в Gemini API, Google AI Studio, Gemini Notebook, Google Vids и в скором времени в Gemini Enterprise.

Полный текст
на сайте deepmind.google
Читать полностью на deepmind.google →