中文

STRIVE: 面向视频问答的结构化时空强化学习探索

计算机视觉与模式识别 2026-05-12 v2

摘要

我们提出了STRIVE(基于重要性感知变体探索的时空强化学习),一种用于视频问答的结构化强化学习框架。虽然基于组的策略优化方法在大规模多模态模型中已显示出潜力,但当响应表现出相似的准确性时,它们常常遭受低奖励方差的问题,导致优势估计弱或不稳定。STRIVE通过为每个输入视频构建多个时空变体,并在文本生成和视觉变体上执行联合归一化来解决这一限制。通过将组比较从语言多样性扩展到结构化视觉扰动,STRIVE丰富了奖励信号,并促进了更稳定和信息量更大的策略更新。为确保探索保持语义基础,我们引入了一种重要性感知采样机制,该机制优先考虑与输入问题最相关的帧,同时保持时间覆盖。这种设计鼓励跨互补视觉视角进行稳健推理,而不是过度拟合单一的时空配置。在六个具有挑战性的视频推理基准(包括VideoMME、TempCompass、VideoMMMU、MMVU、VSI-Bench和PerceptionTest)上的实验表明,在多个大型多模态模型上,该方法相较于强大的强化学习基线取得了持续改进。我们的结果强调了结构化时空探索作为稳定多模态强化学习和提升视频推理性能的一种原则性机制的作用。

关键词

引用

@article{arxiv.2604.01824,
  title  = {STRIVE: Structured Spatiotemporal Exploration for Reinforcement Learning in Video Question Answering},
  author = {Emad Bahrami and Olga Zatsarynna and Parth Pathak and Sunando Sengupta and Juergen Gall and Mohsen Fayyaz},
  journal= {arXiv preprint arXiv:2604.01824},
  year   = {2026}
}