中文

AAPO:通过优势边际提升大语言模型推理能力

机器学习 2026-04-15 v3 计算与语言

摘要

强化学习(RL)已被证明为提升大语言模型(LLMs)推理能力的有效方法,尤其在监督微调(SFT)因链律(CoT)数据有限而不足之处。众所周知,基于组相对优势估计的 RL 后训练方法(如组相对政策优化,GRPO)因无需价值模型而备受关注,从而简化了相较于传统方法(如 PPO)的训练过程。然而,我们注意到现有的组相对优势估计方法在估计优势趋于零时仍存在训练效率问题。为此,我们提出一种名为优势增强政策优化(Advantage-Augmented Policy Optimization, AAPO)的新型 RL 算法,通过基于边际的估计方案增强优势,以优化交叉熵(CE)损失。该方法有效缓解了组相对优势估计的效率瓶颈。在多个数学推理基准测试中,AAPO 显示出优异的性能。代码已公开于 https://github.com/JianxXiong/AAPO。

关键词

引用

@article{arxiv.2505.14264,
  title  = {AAPO: Enhancing the Reasoning Capabilities of LLMs with Advantage Margin},
  author = {Jian Xiong and Jingbo Zhou and Jingyong Ye and Qiang Huang and Dejing Dou},
  journal= {arXiv preprint arXiv:2505.14264},
  year   = {2026}
}

备注

Accepted to ACL2026 Main Conference