中文

基于任务表述、合成监督和受强化 MLLM 解决方案的几何 referring 表达式

机器学习 2025-09-26 v1 人工智能

摘要

AI 驱动的几何问题求解是一项复杂的视觉语言任务,需要准确的图示解读、数学推理以及稳健的跨模态对齐。一个基础且鲜有人关注的能力是根据自然语言查询识别和解释几何元素的能力。为此,我们提出了用于几何问题的 referring 表达式理解(REC)任务,以评估模型是否能响应文本提示,在图中局化点、形状和空间关系。我们Present GeoRef,一个来自现有几何问题语料库构建的基准数据集,具有多样化的高质量标注和查询。由于缺乏此任务的标注数据,我们使用结构化的几何形式语言生成大规模合成训练数据集,涵盖广泛的几何概念,便于模型适应。我们探索了两种微调方法:监督式微调(SFT)和群体相对策略优化(GRPO)。我们的结果表明,GRPO 通过更好地将模型行为与任务特定奖励对齐,显著优于 SFT。此外,我们提出了一种验证-再生成机制,用于检测错误预测并利用上下文推理历史重新推断答案,进一步提升准确率。值得注意的是,尽管存在最先进的多模态大语言模型(MLLM),但在该任务上仍表现不佳,这凸显了在几何问题求解中,将几何对齐明确评估和强化成为必要的前提。此外,在 GeoRef 上训练的模型在下游几何推理任务上也显示出可衡量的改进,突显了 REC 作为多模态数学理解基础的更广泛价值。

关键词

引用

@article{arxiv.2509.21050,
  title  = {GeoRef: Referring Expressions in Geometry via Task Formulation, Synthetic Supervision, and Reinforced MLLM-based Solutions},
  author = {Bing Liu and Wenqiang Yv and Xuzheng Yang and Shichang Wang and Junzhuo Liu and Peng Wang and Guoqing Wang and Yang Yang and Heng Tao Shen},
  journal= {arXiv preprint arXiv:2509.21050},
  year   = {2025}
}