中文

用叙事串联关键帧:MLLM 作为强大的长视频理解器

计算机视觉与模式识别 2025-06-02 v1

摘要

由于大量视频帧(即视觉 token)与语言模型有限上下文长度之间的矛盾,利用多模态大语言模型 (MLLM) 进行长视频理解仍然是一个具有挑战性的问题。传统的均匀采样通常会导致选择无关内容,而在数千帧上对 MLLM 进行后训练则会带来巨大的计算负担。在本文中,我们提出了用叙事串联关键帧 (Nar-KFC),这是一个即插即用的模块,旨在促进高效且有效的长视频感知。Nar-KFC 通常包含两个协同步骤。首先,我们将关键帧选择过程表述为整数二次规划问题,联合优化查询相关性和帧多样性。为避免其计算复杂性,设计了一种定制的贪婪搜索策略作为高效的替代方案。其次,为了缓解稀疏关键帧采样带来的时间不连续性,我们进一步引入了使用现成描述器从非关键帧生成的交错文本叙事。这些叙事根据其真实时间顺序插入到关键帧之间,形成连贯且紧凑的表示。因此,Nar-KFC 作为一种时间和内容感知的压缩策略,互补了视觉和文本模态。在多个长视频基准上的实验结果表明,Nar-KFC 显著提升了主流 MLLM 的性能。代码将公开发布。

关键词

引用

@article{arxiv.2505.24158,
  title  = {Threading Keyframe with Narratives: MLLMs as Strong Long Video Comprehenders},
  author = {Bo Fang and Wenhao Wu and Qiangqiang Wu and Yuxin Song and Antoni B. Chan},
  journal= {arXiv preprint arXiv:2505.24158},
  year   = {2025}
}