中文

通过译者引导的强化学习提升视觉语言模型的几何感知能力

机器学习 2026-02-27 v1

摘要

视觉语言模型(VLMs)常在几何推理方面表现不佳,因其对基本图元元素感知有限。为此,我们提出 GeoPerceive,一个包含图实例及其特定领域语言(DSL)表示的基准,以及高效的自动数据生成管道。该设计使我们能够独立于推理评估几何感知能力。为利用 GeoPerceive 提供的数据增强 VLMs 的几何感知能力,我们提出 GeoDPO,一个译者引导的强化学习(RL)框架。GeoDPO 采用 NL-to-DSL 译者,该译者在 GeoPerceive 数据引擎生成的合成配对上进行训练,以桥接自然语言和 DSL。该译者促进了计算细粒度、DSL 级别的评分,该评分作为强化学习中的奖励信号。我们在域内和域外数据集上评估了 GeoDPO,涵盖几何感知及下游推理任务。实验结果表明,虽然监督微调(SFT)仅提供有限的改进,甚至可能在域外场景中损害性能,但 GeoDPO 实现了显著提升:在域内数据上提升 +26.5%,在域外数据上提升 +8.0%,在下游推理任务上提升 +39.0%。这些发现凸显了 GeoDPO 在性能和泛化能力方面优于 SFT 的优势。所有代码已发布于 https://github.com/Longin-Yu/GeoPerceive 以确保可重复性。

关键词

引用

@article{arxiv.2602.22703,
  title  = {Enhancing Geometric Perception in VLMs via Translator-Guided Reinforcement Learning},
  author = {Hao Yu and Shuning Jia and Guanghao Li and Wenhao Jiang and Chun Yuan},
  journal= {arXiv preprint arXiv:2602.22703},
  year   = {2026}
}