中文

SAGE:通过强化学习训练智能任意视界代理进行长视频推理

计算机视觉与模式识别 2026-03-31 v2

摘要

作为人类,我们是自然的任意视界推理者,即我们可以决定是迭代式浏览长视频还是在必要时完整观看短视频。基于这一点,人们会期望视频推理模型能够在不同持续时间之间灵活推理。然而,现有的最先进模型仍然被训练为在单次推理中预测答案,同时处理大量帧,这类似于观看整个长视频,需要大量资源。这就提出了一个问题:是否有可能开发出性能良好的任意视界视频推理系统?受人类行为的启发,我们首先提出了SAGE,一个在长视频上执行多轮推理同时在单轮中处理简单问题的智能体系统。其次,我们引入了一个使用Gemini-2.5-Flash进行训练的简单合成数据生成流水线,用于训练核心编排器SAGE-MM。第三,我们提出了一种有效的强化学习后训练方案,对于赋予SAGE-MM任意视界推理能力至关重要。第四,我们策划了SAGE-Bench,其平均持续时间超过700秒,用于评估真实娱乐场景中的视频推理能力。最后,我们在开放视频推理任务上观察到了高达6.1%的显著提升,在超过10分钟的视频上观察到了高达8.2%的令人印象深刻的提升,从而经验性地验证了我们的系统、数据和强化学习方案的有效性。

关键词

引用

@article{arxiv.2512.13874,
  title  = {SAGE: Training Smart Any-Horizon Agents for Long Video Reasoning with Reinforcement Learning},
  author = {Jitesh Jain and Jialuo Li and Zixian Ma and Jieyu Zhang and Chris Dongjoo Kim and Sangho Lee and Rohun Tripathi and Tanmay Gupta and Christopher Clark and Humphrey Shi},
  journal= {arXiv preprint arXiv:2512.13874},
  year   = {2026}
}

备注

Project Page: https://praeclarumjj3.github.io/sage/