中文

学习中的强化,推理中的选举:视频推理的双重范式

计算机视觉与模式识别 2026-04-07 v1

摘要

视频推理通过大型多模态模型 (LMM) 取得了进展,但其推理往往是单次传递,不返回答案,也不验证推理是否与证据一致。我们引入学习即强化,推理即选举 (Reinforce to Learn, Elect to Reason, RLER),一种将产生证据的学习过程与获取可靠答案的过程解耦的双重范式。在 RLER-训练中,我们采用基于组相对的强化学习 (RL) 和 3 项新颠任务驱动奖励进行策略优化:帧感知奖励将推理锚定在显式关键帧上,思考透明度奖励塑造可读且可解析的推理痕迹,反重复奖励提升信息密度。这些信号教导模型发出结构化、机器可检查的证据,从而增强推理能力。在 RLER-推理中,我们应用一种无需训练的编排器,生成少数多样化候选方案,解析其答案和引用帧,依据证据一致性、置信度、透明度和非冗余性对其进行评分,然后进行稳健的证据加权选举。这一过程在产生和使用证据之间建立了闭环,提高了可靠性和可解释性,而无需增大模型。我们全面评估了 RLER 与各种开源和基于 RL 的 LMM 在 8 个代表性基准上的表现。RLER 在所有基准上均实现了最先进技术,并在基准模型上实现平均提升 6.3%,同时仅使用平均 3.1 个候选方案 per question,表明计算与质量之间具有有利的平衡。结果支持一种简单论点:在学习过程中使证据显式化,在推理过程中通过证据选举,是可靠视频推理的可靠路径。

关键词

引用

@article{arxiv.2604.04379,
  title  = {Reinforce to Learn, Elect to Reason: A Dual Paradigm for Video Reasoning},
  author = {Songyuan Yang and Weijiang Yu and Jilin Ma and Ziyu Liu and Guijian Tang and Wenjing Yang and Huibin Tan and Nong Xiao},
  journal= {arXiv preprint arXiv:2604.04379},
  year   = {2026}
}

备注

Accepted at CVPR 2026. Camera-ready version