中文

Think-Clip-Sample:面向视频理解的快慢帧选择

计算机视觉与模式识别 2026-01-19 v1 人工智能

摘要

多模态大语言模型 (MLLMs) 的最新进展显著推动了视频理解。然而,它们在长视频上的性能仍受限于计算约束和次优的帧选择。我们提出 Think-Clip-Sample (TCS),一种无需训练的框架,通过两个关键组件增强长视频理解: 多查询推理,生成多个查询以捕获问题和视频的互补方面;以及 片段级快慢采样,自适应地平衡密集局部细节与稀疏全局上下文。在 MLVU、LongVideoBench 和 VideoMME 上的大量实验表明,TCS 在不同的 MLLMs 上持续提升性能,准确率最高提升 6.9%,并且能够以减少 50% 的推理时间成本达到相当的准确率,突显了 TCS 在长视频理解上的效率与有效性。

关键词

引用

@article{arxiv.2601.11359,
  title  = {Think-Clip-Sample: Slow-Fast Frame Selection for Video Understanding},
  author = {Wenhui Tan and Ruihua Song and Jiaze Li and Jianzhong Ju and Zhenbo Luo},
  journal= {arXiv preprint arXiv:2601.11359},
  year   = {2026}
}

备注

Accepted by ICASSP2026