toolcall.
Модели2 сент. 2026 г., 14:26 UTC

Google добавляет agentic video understanding в Gemini

Gemini сможет выборочно разбирать длинные видео, снижая расход токенов и стоимость анализа без отдельной платы за функцию.

Google DeepMind добавляет в Gemini agentic video understanding — новый режим обработки, который должен сделать анализ длинных видео дешевле и точнее.

Вместо того чтобы читать видео с фиксированной частотой кадров, Gemini может сам выбирать, какие фрагменты искать, сканировать и детально смотреть по кадрам, аудио и транскриптам. Это важно для задач, где обработка один кадр в секунду пропускает детали или тратит слишком много токенов на нерелевантные части записи.

Google утверждает, что режим снижает расход токенов до 88%, уменьшает стоимость анализа до 66% и улучшает качество на стандартных бенчмарках video understanding до 7%. Самый заметный эффект компания ожидает на длинных роликах: лекциях, how-to видео, записях наблюдения и многочасовых архивах.

Для разработчиков функция доступна в Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite через Gemini API в Google AI Studio и Gemini Enterprise Agent Platform. Она работает с загруженными видео и YouTube-видео, использует стандартные цены Gemini API и включается через режим обработки agentic.

Google также говорит, что эта возможность появится в Gemini app и позже будет использоваться в Ask YouTube, где пользователь задает вопросы о видео прямо во время просмотра.

Источники

Упоминаются

APIai-videogeminigoogle-deepmindmultimodal-ai