通过链式思考提示与强化学习提升视觉语言模型的空间推理能力
计算机视觉与模式识别
2025-07-21 v1 人工智能
计算与语言
摘要
本研究通过链式思考 (Chain-of-Thought, CoT) 提示与强化学习探讨视觉语言模型 (VLMs) 的空间推理能力。我们首先评估了不同提示策略的影响,发现简单形式的 CoT(即模型在答案前生成推理步骤)不仅无助于提升,甚至可能损害模型原始性能。相反,基于场景图 (SceneGraph) 的结构化多阶段提示显著提高了空间推理准确率。进一步地,为提升空间推理能力,我们在 SAT 数据集上使用群相对策略优化 (Group Relative Policy Optimization, GRPO) 对模型进行微调,并在 CVBench 上评估其性能。与监督微调 (SFT) 相比,GRPO 在 Pass@1 评估中取得更高准确率,并在分布外 (OOD) 条件下表现出更好的鲁棒性。特别地,我们发现 SFT 会过度拟合表层语言模式,在测试时措辞变化(例如从 "closer to" 变为 "farther from")可能导致性能下降。GRPO 则更能泛化,在此类变化下保持稳定性能。我们的发现为改进现代 VLMs 的空间推理能力与泛化行为提供了见解。所有代码已开源于: https://github.com/Yvonne511/spatial-vlm-investigator
引用
@article{arxiv.2507.13362,
title = {Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning},
author = {Binbin Ji and Siddharth Agrawal and Qiance Tang and Yvonne Wu},
journal= {arXiv preprint arXiv:2507.13362},
year = {2025}
}
备注
10 pages, 5 figures, submitted to a conference (IEEE formate). Authored by students from the Courant Institute, NYU