中文

里程碑胜于结果:通过子目标可验证奖励解锁几何推理

机器学习 2026-01-09 v1

摘要

多模态大语言模型 (MLLMs) 在复杂几何推理方面存在困难,这在很大程度上是因为“黑盒”基于结果的监督无法区分侥幸猜中与严密推导。为了解决这个问题,我们引入了向子目标级评估与学习的范式转变。我们首先构建了 GeoGoal,这是一个通过严密的形式验证数据引擎合成的基准,它将抽象证明转化为可验证的数值子目标。这种结构揭示了推理质量与结果准确性之间的关键差异。利用这一点,我们提出了子目标可验证奖励 (SGVR) 框架,该框架基于骨架率用密集奖励取代了稀疏信号。实验表明,SGVR 不仅提高了几何性能 (+9.7%),而且表现出强大的泛化能力,将增益转移到通用数学 (+8.0%) 和其他一般推理任务 (+2.8%) 上,展示了在不同领域的广泛适用性。

关键词

引用

@article{arxiv.2601.05073,
  title  = {Milestones over Outcome: Unlocking Geometric Reasoning with Sub-Goal Verifiable Reward},
  author = {Jianlong Chen and Daocheng Fu and Shengze Xu and Jiawei Chen and Yuan Feng and Yue Yang and Junchi Yan and Hongyuan Zha and Renqiu Xia},
  journal= {arXiv preprint arXiv:2601.05073},
  year   = {2026}
}