细粒度偏好优化提升 VLMs 的空间推理能力
计算机视觉与模式识别
2026-01-06 v3 计算与语言
摘要
当前视觉语言模型 (VLMs) 在处理需要多步骤逻辑和精确空间对齐的细粒度空间推理方面存在困难。 本文介绍了 SpatialReasoner-R1,一种专为解决这些限制而设计的视觉语言推理模型。 为构建空间推理的高质量监督,我们设计了多模型蒙特卡洞树搜索 (Multi-Model Monte Carlo Tree Search, M3CTS) 方法,以生成多样且逻辑一致的长链式思维 (Long Chain-of-Thought, LongCOT) 推理轨迹。 此外,我们提出了细粒度直接偏好优化 (fine-grained Direct Preference Optimization, fDPO) 方法,引入描述性 grounding 和逻辑推理的分段特定偏好细粒度,由空间奖励机制指导,其评估候选响应基于视觉一致性、空间 grounding 和逻辑连贯性。 实验结果表明,fDPO 在空间定性和定量任务上分别相对于标准 DPO 获得 4.1% 和 9.0% 的相对性能提升。 采用 fDPO 训练的 SpatialReasoner-R1 在 SpatialRGPT-Bench 上设定了新的 SOTA,平均准确率超过最强基线 9.4%,同时保持对通用视觉语言任务的竞争性能。
引用
@article{arxiv.2506.21656,
title = {Fine-Grained Preference Optimization Improves Spatial Reasoning in VLMs},
author = {Yifan Shen and Yuanzhe Liu and Jingyuan Zhu and Xu Cao and Xiaofeng Zhang and Yixiao He and Wenming Ye and James Matthew Rehg and Ismini Lourentzou},
journal= {arXiv preprint arXiv:2506.21656},
year = {2026}
}