Flow4Agent:基于光流运动先验的长时段视频理解
计算机视觉与模式识别
2025-10-08 v1
摘要
长时段视频理解始终是一个具有挑战性的问题,由于时空内容存在显著冗余。多模态大语言模型(MLLM)的上下文长度有限,这一挑战进一步加剧。为此,许多先前工作尝试提取关键视频信息,其中“关键”通常是语义感知的,并且高度依赖于CLIP模型作为先验。本文提出Flow4Agent,一种新型框架,首次将光流运动先验纳入以促进基于LLM的长视频理解。Flow4Agent通过两个核心模块在时空水平上消除长视频的冗余:时间粒度优化(TGO)自适应地细化帧级层次结构,首先利用粗糙光流先验对相似视觉内容进行分组,然后应用语义先验过滤掉高度无关的场景信息。运动标记修剪(MTP)进一步细化帧内视觉表示,利用细粒度光流信息修剪高冗余视频标记。广泛的实验表明,我们的Flow4Agent在广泛的视频MLLM基准测试中超越了现有方法,尤其是在小时级视频理解任务方面,分别在Video-MME上达到64.7%,在MLVU上达到71.4%,在LongVideoBench上达到60.4%。
引用
@article{arxiv.2510.05836,
title = {Flow4Agent: Long-form Video Understanding via Motion Prior from Optical Flow},
author = {Ruyang Liu and Shangkun Sun and Haoran Tang and Ge Li and Wei Gao},
journal= {arXiv preprint arXiv:2510.05836},
year = {2025}
}
备注
Accepted to ICCV' 2025