Reinforcing 3D Understanding in Point-VLMs via Geometric Reward Credit Assignment
计算机视觉与模式识别
2026-04-24 v1
摘要
点视觉语言模型承诺能够赋予具象化代理以可执行的空间推理能力,但它们经常会陷入几何幻觉,即预测的 3D 结构与观察到的 2D 现实相矛盾。我们识别出这一失败的关键原因并非表示瓶颈,而是强化学习中的结构性错位,稀疏几何标记被噪声和广播的序列级奖励所淹没。为解决这一因果稀释问题,我们提出了几何奖励信用分配框架,该框架将整体监督信号解耦为特定领域的信号,并将其路由到其负责的标记范围。此机制将模糊的反馈转化为精确的梯度更新,有效地将通用策略优化转化为针对性的结构对齐。此外,我们通过一个重投影一致性项来内化物理约束,该项作为跨模态验证器来惩罚不可能的几何结构。在来自 ShapeNetCore 的校准基准上验证后,我们的方法通过将 3D KPA 从 0.64 提升到 0.93,增加 3D 边界框交并比到 0.686,并将重投影一致性得分提高到 0.852。关键是,尽管保持了稳健的 2D 定位性能,这些提升标志着从合情合理的文本输出迈向可验证的空间预测的重要进展。
引用
@article{arxiv.2604.21160,
title = {Reinforcing 3D Understanding in Point-VLMs via Geometric Reward Credit Assignment},
author = {Jingkun Chen and Ruoshi Xu and Mingqi Gao and Shengda Luo and Jungong Han},
journal= {arXiv preprint arXiv:2604.21160},
year = {2026}
}
备注
10 pages, 3 figures, 5 tables