中文

时序思考链:通过在帧中思考来实现长视频理解

机器学习 2025-07-04 v1

摘要

尽管近期在视觉语言模型(VLM)方面取得了进展,但长视频理解仍是一个具有挑战性的问题。虽然最先进的长上下文VLM可处理约1000个输入帧,但仍难以有效利用这一序列长度,且容易受到上下文窗口中无关干扰项的影响。我们提出了时序思考链(Temporal Chain of Thought),这是一种用于视频问答的推理策略,通过精选模型输入上下文来实现。我们使用VLM本身逐步识别和提取视频中最相关的帧,然后用于回答问题。我们展示了,通过在推理时间获取更多计算资源来选择最相关的上下文可提高准确率,这与最近在LLM推理时间扩展方面的工作一致。此外,我们在4个多样化的视频问答数据集上实现了最先进的成绩,显示出与不同VLM的一致性改进。特别是对于那些不会在模型上下文窗口内完成的更长视频,在LVBench上测试的超过1小时的长视频,我们的方法使用32K的上下文窗口相对于相同VLM使用700K上下文窗口进行标准推理提高了2.8分。

关键词

引用

@article{arxiv.2507.02001,
  title  = {Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames},
  author = {Anurag Arnab and Ahmet Iscen and Mathilde Caron and Alireza Fathi and Cordelia Schmid},
  journal= {arXiv preprint arXiv:2507.02001},
  year   = {2025}
}