面向视觉语言模型物理推理的奖励设计
人工智能
2026-04-16 v1 计算与语言
计算机视觉与模式识别
摘要
对视觉输入进行物理推理需要视觉感知、领域知识与多步符号推理的紧密集成。尽管当前最先进的视觉语言模型(VLM)在物理基准测试中仍远不及人类水平。虽然监督微调(SFT)和群体相对策略优化(GRPO)等后训练算法在语言模型中已显示出强大的推理提升,但奖励设计如何塑造 VLM 物理推理行为仍鲜为人知。我们对基于 GRPO 的 VLM 物理推理训练进行系统性奖励消除实验。我们比较四种语义丰富度递增的奖励信号:格式合规性、答案准确性、复合评分奖励(答案正确性、物理原理识别、单位一致性)以及源自模型注意力权重对输入图像区域的 novel internal reward。我们在覆盖六个物理学科域、六种推理类型的 3000 题 benchmark(涵盖多选题与开放式问题)上进行评估,使用 IBM Granite Vision 3.3(2B)。在两种格式下,GRPO 采用基于准确性的奖励在大多数学科上优于 SFT,尽管各奖励类型和学科的提升差异显著。奖励设计并不总是提升性能,而是诱导特定学科的推理行为。基于准确性的奖励提供最强的整体提升。评分奖励改善结构化推理质量,但不一致提升准确性。基于注意力的奖励增强空间推理,同时在符号学域中导致性能下降。我们的内部注意力权重奖励无需空间注释即可提升空间关系准确性,从 0.27 提升至 0.50,表明监督模型在生成期间所关注的区域是视觉 grounding 物理推理的有前景方向。
引用
@article{arxiv.2604.13993,
title = {Reward Design for Physical Reasoning in Vision-Language Models},
author = {Derek Lilienthal and Manisha Mukherjee and Sameera Horawalavithana},
journal= {arXiv preprint arXiv:2604.13993},
year = {2026}
}