基于事件锚点的有效长视频理解帧选择
计算机视觉与模式识别
2026-03-03 v1
摘要
大量帧冗余及有限上下文窗口,使得在大型视觉语言模型(LVLMs)中进行长视频理解时,高效帧选择至关重要。现有方法采用平坦采样范式,将视频视为无结构的帧集合。本文引入事件锚定帧选择(EFS),构建层次化、事件感知的管道。利用自监督DINO嵌入,EFS首先将视频流划分为视觉上同质的时序片段,作为语义事件的代理。随后在每个事件内部选取最具查询相关性的帧作为锚点。这些锚点作为结构性先验,指导全局精炼阶段,采用自适应最大边际相关性(MMR)方案。该管道确保最终关键帧集合在事件覆盖、查询相关性及视觉多样性三方面 jointly 优化。作为一种无训练、即插即用的模块,EFS可无缝集成至成熟的LVLMs,使其在挑战性视频理解基准上取得显著提升。具体而言,当应用于LLaVA-Video-7B时,EFS在VideoMME、LongVideoBench及MLVU上的准确率分别提升4.7%、4.9%及8.8%。
引用
@article{arxiv.2603.00983,
title = {Event-Anchored Frame Selection for Effective Long-Video Understanding},
author = {Wang Chen and Yongdong Luo and Yuhui Zeng and Luojun Lin and Tianyu Xie and Fei Chao and Rongrong Ji and Xiawu Zheng},
journal= {arXiv preprint arXiv:2603.00983},
year = {2026}
}