中文

FrameThinker:通过多轮帧聚光学习处理长视频

计算机视觉与模式识别 2025-10-01 v2

摘要

尽管大型视觉语言模型 (LVLMs) 在视频理解方面取得了显著进展,但其在长视频推理中的应用受到统一帧抽样和静态文本推理的制约,这两者效率低下且难以处理视觉密集型视频任务。为克服这些挑战,本文提出“与长视频进行思考”的概念,并提出一种新框架 FrameThinker。在此框架下,LVLMs 能够迭代地询问视频内容。开发此类视频推理能力在 LVLMs 中 presents notable 挑战,特别是适应新视频动作(例如选择帧)以及设计奖励函数以引导 LVLMs 采用新引入的动作。为解决这些挑战,我们提出了两种训练策略:首先采用监督微调 (SFT) 以灌输基本动作能力,随后采用强化学习 (RL) 优化决策策略。值得注意的是,在此 RL 阶段,我们对每种动作和格式的奖励设计进行深入且全面的探索。大量实验表明,FrameThinker 在 Video-Holmes、LongVideo-Reason 等推理基准以及 LongVideoBench、MLVU、VideoMME 和 LVBench 等长视频理解基准上实现显著的平均提升幅度为 +10.4%,同时大幅减少了处理帧的数量。最值得注意的是,我们的 7B 模型 FrameThinker 在 LongVideo-Reason 上建立了最新的 SOTA,准确率达 76.1%,平均仅使用 20.6 个帧。 这不仅在 512 帧以上(相较于竞争性 LongVILA-R1 的 72.0%)的 20 倍以上,更显示出了无与伦比的效率和效果。

关键词

引用

@article{arxiv.2509.24304,
  title  = {FrameThinker: Learning to Think with Long Videos via Multi-Turn Frame Spotlighting},
  author = {Zefeng He and Xiaoye Qu and Yafu Li and Siyuan Huang and Daizong Liu and Yu Cheng},
  journal= {arXiv preprint arXiv:2509.24304},
  year   = {2025}
}