中文

MDP3:一种用于视频大语言模型中列表式帧选择的免训练方法

计算机视觉与模式识别 2025-10-29 v2 机器学习

摘要

视频大语言模型(Video-LLMs)在视频理解方面取得了显著进展。然而,处理多帧会导致冗长的视觉标记序列,带来挑战,例如有限的上下文长度无法容纳整个视频,以及包含不相关帧会阻碍视觉感知。因此,有效的帧选择至关重要。本文强调帧选择应遵循三个关键原则:查询相关性、列表多样性和顺序性。现有方法,如均匀帧采样和查询-帧匹配,并未涵盖所有这些原则。因此,我们提出了基于马尔可夫决策行列式点过程与动态规划(MDP3)的帧选择方法,这是一种无需训练且与模型无关的方法,可以无缝集成到现有的Video-LLMs中。我们的方法首先在再生核希尔伯特空间(RKHS)中使用条件高斯核估计基于查询的帧相似性。然后,我们将行列式点过程(DPP)应用于相似性矩阵,以捕获查询相关性和列表多样性。为了融入顺序性,我们对视频进行分段,并在每个分段内应用DPP,条件依赖于前一分段的选择,建模为马尔可夫决策过程(MDP),用于分配各分段的选取大小。理论上,MDP3为NP难的列表式帧选择问题提供了(1 - 1/e)近似解,具有伪多项式时间复杂度,证明了其效率。实验上,MDP3显著优于现有方法,验证了其有效性和鲁棒性。

关键词

引用

@article{arxiv.2501.02885,
  title  = {MDP3: A Training-free Approach for List-wise Frame Selection in Video-LLMs},
  author = {Hui Sun and Shiyin Lu and Huanyu Wang and Qing-Guo Chen and Zhao Xu and Weihua Luo and Kaifu Zhang and Ming Li},
  journal= {arXiv preprint arXiv:2501.02885},
  year   = {2025}
}

备注

26 pages, 14 figures