Google запускает Gemini 3.8 Live для голосовых агентов
Новые модели Live и Extended Thinking дают Gemini более быстрый голосовой диалог, визуальный контекст, фоновые вызовы инструментов и более сильное рассуждение.

Google выпускает Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking — пару моделей для почти мгновенного голосового диалога, голосовых агентов и spoken AI-сценариев. Базовая версия рассчитана на масштабирование, более низкую стоимость, плавный разговор и визуальный контекст, а Extended Thinking предназначена для сложных задач, где нужно рассуждать в несколько шагов, не прерывая беседу.
Это важно, потому что голосовые агенты переходят из демо в реальные продукты: поддержку, поиск, рабочие инструменты и клиентские сервисы. Google заявляет, что Gemini 3.8 Live умеет учитывать визуальный ввод, переключаться между 97 языками прямо во время разговора и вызывать инструменты или API в фоне, продолжая отвечать голосом. Extended Thinking добавляет проговаривание прогресса и параллельное рассуждение, чтобы пользователь не ждал молча во время длинных действий.
Для разработчиков обе модели доступны через Gemini API и AI Studio. Для бизнеса запуск идет через private preview в Gemini Enterprise, а для обычных пользователей — через Search Live, Gemini Live и отдельные сценарии Workspace. Google также говорит, что сгенерированное аудио маркируется SynthID, что становится все важнее по мере массового внедрения синтетического голоса.
Источники
- Googleblog.google