Медиа о новых технологиях · ИИ, роботы, биотех, наука, космосС датой и первоисточником · est. 2026

Главная / Лента

Gemini 3.8 TTS: Google научила нейросеть озвучивать текст любым голосом — иллюстрация
Иллюстрация создана ИИ

Gemini 3.8 TTS: Google научила нейросеть озвучивать текст любым голосом

ИИУровень: Новичок

№ 00 OK Материал подготовлен с помощью ИИ и проверен по первоисточникам · обновлено · 3 мин чтения

Первоисточник: Google · событие

Короткий ответ: 23 сентября Google выпустила две модели для озвучки текста — Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. Первая рассчитана на творческую работу: голос можно создать по текстовому описанию, выбрать из библиотеки в 2000 с лишним голосов или воссоздать по 30-секундной записи с согласия владельца. Вторая — на массовую озвучку и голосовых ассистентов, где важна цена. Заявлена поддержка более 100 языков. Модели доступны разработчикам в Gemini API и Google AI Studio, обычным пользователям — в сервисах Gemini Notebook и Google Vids.

Главное:

Что произошло

Раньше у Google было 30 заранее записанных голосов. Теперь голос можно заказать словами: «энергичный диджей из Мельбурна», «монотонный робот», «рассказчик с региональным акцентом». Дальше модель ведёт текст построчно по ремаркам — темп, эмоция, пауза, смех, короткие реплики «угу» и «ага» в диалоге. Она держит один и тот же голос на часах непрерывной записи и умеет разыгрывать сцену двух собеседников по одному сценарию.

По данным Google, Flash TTS заняла первое место в бенчмарке Hume AI по созданию голосов и в его общем индексе качества, а в слепых сравнениях Voice Arena модели лидируют на японском, бразильском португальском, вьетнамском, арабском, мексиканском испанском и хинди.

Почему это важно

Озвучка перестаёт быть отдельной профессией с микрофоном и студией для типовых задач: аудиокниги, подкасты, дубляж видео, голосовые ассистенты поддержки. Google прямо называет партнёров, которые встраивают модель в дубляж и локализацию.

Вторая сторона — подделка голоса. Google отвечает на это двумя мерами: копия голоса создаётся только после записанного согласия его владельца, а каждый фрагмент помечается невидимым водяным знаком SynthID. Это та же логика, что и у требований к маркировке ИИ-контента, которые обсуждают регуляторы во многих странах.

Что это значит для читателя

Сервисы Google с моделями Gemini официально не работают в России, поэтому прямого доступа к Google AI Studio нет. Если вы делаете видео, подкасты или обучающие курсы, стоит следить за двумя вещами: появится ли модель у российских сервисов-агрегаторов, которые работают через API, и как она звучит по-русски — в анонсе русский отдельно не упомянут, а качество озвучки на разных языках сильно различается.

Для всех остальных практический вывод другой: реалистичный синтетический голос стал дешёвым и массовым. Звонок «от родственника» или «из банка» знакомым голосом — больше не экзотика. Правило простое: срочную просьбу о деньгах голосом проверяйте перезвоном на известный номер.

Честное ограничение. Все результаты сравнений — из материалов Google. Цены на API в анонсе не приведены. Функция копирования голоса в AI Studio недоступна в ЕЭЗ, Великобритании, Швейцарии, Индии и двух штатах США.

Читать рядом: Нейросеть для видео: что выбрать · Какие модели ИИ есть в мире — живой каталог · ElevenLabs оценили в 22 млрд долларов

Частые вопросы

Что умеет Gemini 3.8 Flash TTS?

Озвучивает текст: можно выбрать один из более чем 2000 готовых голосов или описать новый словами — возраст, характер, акцент. Модель держит один голос на часах записи, ведёт диалог двух голосов по сценарию и понимает ремарки вроде смеха или вздоха. По 30-секундной записи можно воссоздать голос, если есть согласие его владельца.

Поддерживается ли русский язык?

Google заявляет больше 100 языков и диалектов, но русский в анонсе отдельно не назван — лидирующие результаты компания приводит для японского, португальского, вьетнамского, арабского, испанского и хинди. Качество русской озвучки нужно проверять самостоятельно.

Как отличить голос, сгенерированный Gemini?

Каждый аудиофрагмент моделей Gemini Audio помечается невидимым водяным знаком SynthID, который обнаруживается специальным детектором. На слух его не услышать. Для копирования чужого голоса система требует записанное голосом владельца согласие.