中文

GeoLaux:面向几何问题基准评估的 MLLM 长步骤问题数据集

人工智能 2026-05-15 v4

摘要

几何问题求解(GPS)在多模态大语言模型(MLLM)的图表理解、知识应用、长步骤推理和辅助线构造方面存在诸多挑战。然而,现有基准缺乏对长步骤需辅助构造问题的细粒度评估。为此,我们提出GeoLaux,一个包含 2186 个计算与证明问题的细粒度标注数据集。该数据集涵盖长步骤推理(平均解题长度为 6.51 步,最长为 24 步)和辅助线构造(41.8% 的问题需辅助线构造)。基于该数据集,我们对 23 所领先的 MLLM 进行了五维度综合评估。评估结果得出三项关键发现:首先,模型在长步骤问题上的表现显著低于短步骤问题,其中 18 个模型的性能下降超过 50%。其次,增强模型的理解、意识和辅助线构造能力至关重要,这对整体几何推理至关重要。第三,有限的答案提示有效提升过程正确性,而明确的答案则导致模型忽视中间推理步骤。这些发现表明,GeoLaux 不仅可用于基准测试 MLLM 的几何推理能力,也可用于指导其改进。数据和代码已公开 disponible at https://github.com/Candice-yu/GeoLaux

关键词

引用

@article{arxiv.2508.06226,
  title  = {GeoLaux: A Benchmark for Evaluating MLLMs' Geometry Performance on Long-Step Problems Requiring Auxiliary Lines},
  author = {Yumeng Fu and Jiayin Zhu and Lingling Zhang and Wenjun Wu and Bo Zhao and Shaoxuan Ma and Yushun Zhang and Jun Liu},
  journal= {arXiv preprint arXiv:2508.06226},
  year   = {2026}
}

备注

26 pages, 24 figures