中文

更难更好:通过难度感知GRPO与多维度问题改写提升数学推理

人工智能 2026-01-29 v1 计算与语言

摘要

基于可验证奖励的强化学习(RLVR)为增强大模型的数学推理提供了稳健机制。然而,我们从算法和数据两个角度识别出现有方法在强调更具挑战性的问题方面存在系统性不足,尽管这些问题对完善尚未发展的能力至关重要。算法上,广泛使用的群体相对策略优化(GRPO)存在隐式不平衡,即难问题的策略更新幅度较小。数据方面,增强方法主要通过改写问题来提高多样性,而未系统性地提高问题的内在难度。为此,我们提出了一个双重MathForge框架,通过两个角度针对更难的问题来提高数学推理能力,包括难度感知群体政策优化(DGPO)算法和多维度问题改写(MQR)策略。具体而言,DGPO首先通过难度平衡的群体优势估计纠正GRPO中的隐式不平衡,进一步通过难度感知的问题级加权优先处理更难的问题。与此同时,MQR通过多方面改写问题来提高难度,同时保持原始金标准答案。总体而言,MathForge形成一个协同循环:MQR扩展数据前沿,DGPO有效学习从 augmented 数据中。广泛实验表明,MathForge在各种数学推理任务上显著优于现有方法。代码和增强数据均可在https://github.com/AMAP-ML/MathForge获取。

关键词

引用

@article{arxiv.2601.20614,
  title  = {Harder Is Better: Boosting Mathematical Reasoning via Difficulty-Aware GRPO and Multi-Aspect Question Reformulation},
  author = {Yanqi Dai and Yuxiang Ji and Xiao Zhang and Yong Wang and Xiangxiang Chu and Zhiwu Lu},
  journal= {arXiv preprint arXiv:2601.20614},
  year   = {2026}
}

备注

Accepted for ICLR 2026