欧几里得的礼物:通过几何代理任务提升视觉语言模型的空间感知与推理能力
计算机视觉与模式识别
2025-11-20 v3 人工智能
计算与语言
机器学习
摘要
空间智力涵盖了丰富的能力集合,包括可视化和转换形状、精神旋转物体、判断相对位置和包含关系,以及估计数目。然而,这仍是多模态大语言模型(MLLMs)面临的关键未解决挑战。为填补这一空白,我们提出将欧几里得几何问题解决作为代理任务。具体而言,我们精心构建了一个精选的多模态数据集,称为Euclid30K,包含约30K个平面和立体几何问题。此外,为使模型能够从这些几何问题中学习和应用欧几里得原理,我们使用群相对策略优化(GRPO)对来自Qwen2.5VL、Qwen3VL和RoboBrain2.0系列的七个模型变体(规模从30亿到720亿参数)进行微调,使模型能够识别形状、计数、关联实体,并运用欧几里得原理进行多步演绎推理。我们的实验表明,所得模型在四个空间推理基准测试(Super-CLEVR、Omni3DBench、VSI-Bench和MindCube)上实现了显著的零样本提升,无需任何任务特定的适配。值得注意的是,在训练Euclid30K后,VSI-Bench的平均准确率从36.6%提升至41.8%(提升5.2%),MindCube的平均准确率从31.4%提升至38.1%(提升6.7%)。在我们看来,这是首次系统性地表明几何中心微调可为视觉语言模型赋予广泛可迁移的空间技能。代码和Euclid30K数据集可在\href{https://zgca-ai4edu.github.io/Euclids_Gift}{此处}获取。
引用
@article{arxiv.2509.24473,
title = {Euclid's Gift: Enhancing Spatial Perception and Reasoning in Vision-Language Models via Geometric Surrogate Tasks},
author = {Shijie Lian and Changti Wu and Laurence Tianruo Yang and Hang Yuan and Bin Yu and Lei Zhang and Kai Chen},
journal= {arXiv preprint arXiv:2509.24473},
year = {2025}
}