中文

光滑算子:光滑可验证奖励激活视觉语言模型的空间推理能力

计算机视觉与模式识别 2026-01-16 v2

摘要

视觉语言模型 (Vision-Language Models, VLMs) 在实现对3D场景精准数值预测方面面临关键瓶颈。传统强化学习 (RL) 方法主要基于相对排序,常因奖励稀疏和梯度不稳定而难以有效利用由3D物理约束提供的可验证信号。值得注意的是,在标准GRPO框架中,由于相对归一化,具有小但非零误差特征的“近似样本”会出现优势坍缩。这导致严重的数据利用瓶颈:在优化过程中,珍贵的边界样本被丢弃。为解决此问题,本文引入光滑数值奖励激活 (Smooth Numerical Reward Activation, SNRA) 算子和绝对-preserving GRPO (AP-GRPO) 框架。SNRA采用动态参数Sigmoid函数将原始反馈转化为稠密连续奖励谱。同时,AP-GRPO集成绝对标量梯度,以缓解常规相对排序机制固有的numerical信息损失。通过该方法,我们构建了Numerical3D-50k数据集,包含50,000个可验证的3D子任务。实证结果表明,AP-GRPO在保持更高数据效率的同时,实现与大规模监督方法持平的性能,有效激活VLMs中潜在的3D推理能力,且无需架构修改。

关键词

引用

@article{arxiv.2601.07695,
  title  = {Smooth Operator: Smooth Verifiable Reward Activates Spatial Reasoning Ability of Vision-Language Model},
  author = {Siwen Jiao and Tianxiong Lv and Kangan Qian and Chenxu Zhao and Xiuyuan Zhu and Tianlun Li and Xiaolong Cheng and Jinyu Li and Zhihao Liao and Yang Cai},
  journal= {arXiv preprint arXiv:2601.07695},
  year   = {2026}
}