GeoVLMath:基于跨模态奖励增强视觉语言模型几何推理的辅助线创建
计算机视觉与模式识别
2026-01-27 v2 人工智能
摘要
辅助线是解决复杂几何问题的关键,但对大型视觉语言模型(LVLM)仍具有挑战。近期尝试通过代码驱动渲染构建辅助线,依赖于准确可执行的代码生成以产生辅助线的视觉渲染用于后续推理。然而,在复杂实体几何场景中,这种对精确规格的强依赖显著限制了其鲁棒性。或者,我们转向更简单且更稳定的解决方案,将辅助线构造表示为结构化文本描述。为桥接文本描述与空间结构之间的差距,我们提出强化学习框架以增强图表文本对齐。核心是跨模态奖励模型,评估生成的辅助线描述与真实辅助线图示的匹配程度。奖励信号驱动 GRPO-based RL 阶段,产生信息丰富的辅助线描述用于推理。为支持训练和评估,我们开发可扩展的数据管道,构建 AuxSolidMath 数据集,包含 3018 个真实考试几何问题,配套图示和对齐的文本字段。基于此框架,我们得到 GeoVLMath,一个用于解决复杂实体几何的 LVLM。
引用
@article{arxiv.2510.11020,
title = {GeoVLMath: Enhancing Geometry Reasoning in Vision-Language Models via Cross-Modal Reward for Auxiliary Line Creation},
author = {Shasha Guo and Liang Pang and Xi Wang and Yanling Wang and Huawei Shen and Jing Zhang},
journal= {arXiv preprint arXiv:2510.11020},
year = {2026}
}
备注
19 pages