toolcall.
26 авг. 2026 г., 20:26 UTC

Google открывает Gemini 3.5 Transcribe для разработчиков

Speech-to-text модель поддерживает стриминг, запись аудио, разделение спикеров, custom vocabulary и более 85 языков.

Gemini 3.5 Transcribe product image from Google DeepMind

Google DeepMind представила Gemini 3.5 Transcribe — speech-to-text модель для разработчиков, которые строят голосовых агентов, live captions, инструменты для встреч и аналитику звонков.

Модель доступна через Gemini API в Google AI Studio и Gemini Enterprise Agent Platform. По словам Google, она поддерживает real-time streaming через Live API и обработку записанного аудио через Interactions API, включая атрибуцию спикеров и word-level timestamps для заранее записанных материалов.

Google подает релиз как шаг дальше обычной транскрибации. Gemini 3.5 Transcribe умеет убирать слова-паразиты, учитывать самоисправления, адаптироваться к custom vocabulary и транскрибировать более 85 языков с региональными акцентами и диалектами. Компания заявляет средний word error rate 4,0% для streaming и 2,6% для non-streaming сценариев, а также улучшение time to final transcription на 70% относительно Chirp 3 по измерениям Artificial Analysis.

Практический смысл в том, что голосовые интерфейсы двигаются от сырой диктовки к контекстному вводу. Если показатели подтвердятся в продакшене, разработчики получат более сильную базу для agent calls, поддержки и hands-free writing без отдельной сборки слоев очистки и форматирования текста.

Источники