中文

从帧到片段:无训练自适应关键片段选择用于长视频理解

计算机视觉与模式识别 2025-12-19 v2

摘要

视频大语言模型(VLM)在各种视觉语言任务上取得了强劲性能,但其实际应用受到来自原始视频帧的大量视觉标记的限制,这些标记迅速耗尽模型的上下文窗口。现有解决方案通过选择稀疏帧集来缓解此问题,但逐帧选择丢弃了长视频中的关键时间动态,导致对运动和事件连续性的推理次优。在这项工作中,我们系统地研究了时间信息的作用,并表明将选择从孤立的关键帧扩展到时间连贯的关键片段可以改善视频理解。为了在固定计算预算内容纳片段的更大标记占用,我们引入帧分辨率作为帧选择中的可控因素,实现了空间分辨率与片段长度之间的权衡。基于这一思路,我们提出了一种自适应片段长度模块,动态平衡这些因素以确保每个视频的恒定标记数。在三个长视频基准上的实验表明,我们的无训练方法 F2C 在 Video-MME、LongVideoBench 和 MLVU 上分别优于均匀采样 8.1%、5.6% 和 10.3%。这些结果强调了保留帧选择中时间连贯性的重要性,并为将 VLM 扩展到真实世界视频理解应用提供了实际途径。项目网页位于 https://guangyusun.com/f2c 。

关键词

引用

@article{arxiv.2510.02262,
  title  = {From Frames to Clips: Training-free Adaptive Key Clip Selection for Long-Form Video Understanding},
  author = {Guangyu Sun and Archit Singhal and Burak Uzkent and Mubarak Shah and Chen Chen and Garin Kessler},
  journal= {arXiv preprint arXiv:2510.02262},
  year   = {2025}
}