GeometryZero:通过群对比策略优化提升几何解题
计算与语言
2026-04-21 v3
摘要
最近的大语言模型(LLM)进展推动了数学推理,但几何问题仍具有挑战性,其中常需要辅助构造。先前的方法要么表现不佳,要么依赖非常大的模型(如 GPT-4o),使其成本高昂。我们认为,利用可验证奖励(如 GRPO)进行的强化学习可以训练较小的模型以将辅助构造与坚实的几何推理耦合。然而, naively 应用 GRPO 会产生无条件奖励,鼓励不加区分且有时有害的构造。我们提出群对比策略优化(GCPO),一种具有两个组成部分的 RL 框架:(1)群对比掩码,根据上下文效用分配正/负构造奖励;(2)长度奖励,鼓励更长的推理链。我们在 GCPO 上构建 GeometryZero,一套经济实惠的几何推理模型,选择性地使用辅助构造。在 Geometry3K 和 MathVista 上的实验表明,GeometryZero 一致优于 RL 基线(如 GRPO、ToRL)。代码已在 https://github.com/ekonwang/GeometryZero 上提供。
引用
@article{arxiv.2506.07160,
title = {GeometryZero: Advancing Geometry Solving via Group Contrastive Policy Optimization},
author = {Yikun Wang and Yibin Wang and Dianyi Wang and Zimian Peng and Qipeng Guo and Dacheng Tao and Jiaqi Wang},
journal= {arXiv preprint arXiv:2506.07160},
year = {2026}
}