Faithful GRPO:通过受约束的策略优化提升多模态语言模型的视觉空间推理
计算机视觉与模式识别
2026-04-10 v1 人工智能
摘要
使用可验证奖励(RLVR)训练的多模态推理模型(MRMs)在视觉推理基准测试中显示出 improved 的准确性。然而,我们注意到准确性提升常常以牺牲推理质量为代价:生成的链式思维(CoT)轨迹常常与最终答案不一致且未在视觉证据上得到良好 grounding。我们在七个具有挑战性的真实世界空间推理基准测试中系统性地研究了这一现象,发现影响了ViGoRL-Spatial、TreeVGR等当代MRMs以及我们自己的模型,这些模型使用标准的Group Relative Policy Optimization(GRPO)进行训练。我们沿两个互补的轴向对CoT推理质量进行表征:逻辑一致性(CoT是否蕴含最终答案?)和视觉 grounding(每一步推理是否准确描述图像中的对象、属性和空间关系?)。为此,我们提出Faithful GRPO(FGRPO),这是一种GRPO的变体,通过拉格朗日对偶升降法将一致性和grounding作为约束强制执行。FGRPO将 batch 级别的一致性和grounding约束整合到组内的 advantage computation中,自适应调整约束的相对重要性。我们在Qwen2.5-VL-7B和3B backbone上评估FGRPO,覆盖七个空间数据集。我们的结果表明,FGRPO显著提升了推理质量,将不一致率从24.5%降至1.7%,并将视觉 grounding得分提升13个百分点。它还在简单GRPO之上提高了最终答案的准确性,证明了可靠推理有助于获得更好的答案。
引用
@article{arxiv.2604.08476,
title = {Faithful GRPO: Improving Visual Spatial Reasoning in Multimodal Language Models via Constrained Policy Optimization},
author = {Sai Srinivas Kancheti and Aditya Kanade and Rohit Sinha and Vineeth N Balasubramanian and Tanuja Ganu},
journal= {arXiv preprint arXiv:2604.08476},
year = {2026}
}