借助视频 grounding 进行推理:基于视频 grounding 的长视频理解 curriculum 强化学习
摘要
长视频理解因其在长时间范围内的丰富且复杂的多模态线索而具有挑战性。现有方法采用推理以提高模型分析长视频中复杂线索的能力,但现有文献 suffers from 文本唯一推理在固定视频上下文下可能加剧幻觉,因为由于长视频的时间冗余,详细的关键线索常在有限的视频上下文长度下被忽略。为此,我们提出 Video-TwG,一个基于视频 grounding 的 curriculum 强化框架,使视频 LLM 能够在交错的文本-视频推理期间主动决定何时进行按需 grounding,以便在必要时仅选择与问题相关的片段。Video-TwG 可以以一种直接的方式进行端到端训练,不依赖复杂的辅助模块或密集标注的推理痕迹。具体而言,我们设计了 Two-stage Reinforced Curriculum Strategy,即模型首先在小型短视频 GQA 数据集上学习 think-with-grounding 行为,然后扩展到多样化的通用 QA 数据,以鼓励泛化。进一步,为处理各种类型的数据的复杂 think-with-grounding 推理,我们提出 TwG-GRPO 算法,其特点是细粒度 grounding reward、自确认伪 reward 和 accuracy-gated 机制。最后,我们提出构建一个新的 TwG-51K 数据集以促进训练。在 Video-MME、LongVideoBench 和 MLVU 上的实验表明,Video-TwG 在所有强大的长视频理解基准上均表现出色。进一步的消融实验验证了 Two-stage Reinforced Curriculum Strategy 的必要性,并表明 TwG-GRPO 更有效地利用多样化的无标签数据来提高 grounding 质量并减少冗余 grounding,而不牺牲 QA 性能。
引用
@article{arxiv.2602.18702,
title = {Think with Grounding: Curriculum Reinforced Reasoning with Video Grounding for Long Video Understanding},
author = {Houlun Chen and Xin Wang and Guangyao Li and Yuwei Zhou and Yihan Chen and Jia Jia and Wenwu Zhu},
journal= {arXiv preprint arXiv:2602.18702},
year = {2026}
}