Google DeepMind представила функцию agentic video understanding для моделей Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Нововведение стало доступно разработчикам через Google AI Studio и платформу Gemini Enterprise Agent Platform, об этом сообщается в официальном блоге компании.
В отличие от стандартного метода, при котором модель обрабатывает видеофайл с фиксированной частотой кадров (по умолчанию 1 FPS), агентный режим позволяет Gemini самостоятельно определять, какие именно отрезки видео, аудиодорожки или текстовые расшифровки требуются для выполнения задачи. Нейросеть обращается к встроенным инструментам и запрашивает только релевантные фрагменты через агентный цикл.
По данным разработчиков, переход на динамическое сканирование сокращает потребление токенов до 88%, а затраты на API — до 66%. При этом точность ответов на стандартных бенчмарках выросла в среднем на 7%.
В компании отмечают, что наибольшую экономию инструмент показывает при анализе длинных записей — от 10-минутных инструкций до многочасовых лекций и стримов. Кроме того, Gemini 3.7 Flash в агентном режиме способна динамически повышать частоту кадров на нужных участках, что повышает точность распознавания быстрых действий и подсчета объектов.





Пока нет комментариев. Будьте первым!