Google добавляет agentic video understanding в Gemini
Gemini сможет выборочно разбирать длинные видео, снижая расход токенов и стоимость анализа без отдельной платы за функцию.
Google DeepMind добавляет в Gemini agentic video understanding — новый режим обработки, который должен сделать анализ длинных видео дешевле и точнее.
Вместо того чтобы читать видео с фиксированной частотой кадров, Gemini может сам выбирать, какие фрагменты искать, сканировать и детально смотреть по кадрам, аудио и транскриптам. Это важно для задач, где обработка один кадр в секунду пропускает детали или тратит слишком много токенов на нерелевантные части записи.
Google утверждает, что режим снижает расход токенов до 88%, уменьшает стоимость анализа до 66% и улучшает качество на стандартных бенчмарках video understanding до 7%. Самый заметный эффект компания ожидает на длинных роликах: лекциях, how-to видео, записях наблюдения и многочасовых архивах.
Для разработчиков функция доступна в Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite через Gemini API в Google AI Studio и Gemini Enterprise Agent Platform. Она работает с загруженными видео и YouTube-видео, использует стандартные цены Gemini API и включается через режим обработки agentic.
Google также говорит, что эта возможность появится в Gemini app и позже будет использоваться в Ask YouTube, где пользователь задает вопросы о видео прямо во время просмотра.
Источники
- Google DeepMindblog.google