中文

LDDR:基于线性行列式点过程的动态分辨率视频帧采样方法,用于视频多模态大语言模型

计算机视觉与模式识别 2026-05-13 v1

摘要

在多模态大语言模型中进行视频理解,需要在有限的视觉令牌预算下,从冗长、冗余的视频中选择信息丰富的帧。现有方法通常依赖于均匀采样、逐点相关性评分、分块选择或智能体探索,这些方法要么忽略了全局依赖关系,要么引入了显著的开销。我们提出了 LDDR(基于线性行列式点过程的动态分辨率),一个无需训练、即插即用且预算感知的视频帧采样框架。LDDR 在任务条件化的特征空间中执行查询感知的行列式点过程(DPP)帧选择,相比标准 DPP 基线实现了 3 倍的运行速度提升。它进一步引入了组 DPP 重要性度量来指导帧保留和动态分辨率分配,为信息丰富、非冗余的帧分配更多令牌,同时降低或剪枝不太有用的帧的分辨率。在涵盖短、中、长视频的四个视频基准测试中,LDDR 始终优于次优基线,在预算受限设置下实现了 2.5 个点的增益,在高预算场景下实现了 1.6 个点的增益。这些改进在多个 MLLM 骨干模型(包括开源和闭源模型)上均一致观察到。定性分析证实,相关帧被选中并分配了更高的预算,从而促进了视频理解的提升。

关键词

引用

@article{arxiv.2605.11477,
  title  = {LDDR: Linear-DPP-Based Dynamic-Resolution Frame Sampling for Video MLLMs},
  author = {Jingfeng Chen and Jiawen Qian and Wendi Deng and Yinuo Guo and Jiaqi Yu and Sicong Leng and Raghuveer Thirukovalluru and Bhuwan Dhingra},
  journal= {arXiv preprint arXiv:2605.11477},
  year   = {2026}
}

备注

21 pages, 4 figures