中文

AGPO:基于双统计反馈的自适应分组策略优化

机器学习 2026-05-21 v1 人工智能

摘要

强化学习改进了LLM推理,但PPO/GRPO通常使用固定的裁剪和解码温度,导致训练脆弱且调参-heavy。我们提出自适应分组策略优化(AGPO)——一种来自GRPO的无评论家改进版,利用组级统计信息控制更新幅度和探索。AGPO使用基于探测器派生的统计状态驱动两个控制器:(i)自适应裁剪,根据奖励离散度和偏斜度、探测器投票熵、策略熵以及步骤级KL漂移设置信任区域大小;(ii)双向自适应温度采样,根据相对于运行基准的中心化不确定性对解码进行加热或冷却。 在九个英文和中文数学/STEM基准测试中,采用AGPO训练的Qwen2.5-14B在相同生成token预算下超越PPO/GRPO,GSM8K达到67.3%,MATH达到40.5%。该方法可迁移至Llama-3-8B和Gemma-2-9B,消融实验确认两个模块互为补充。我们的实现已公开于https://github.com/wandugu/paper_agpo。

关键词

引用

@article{arxiv.2605.20722,
  title  = {AGPO: Adaptive Group Policy Optimization with Dual Statistical Feedback},
  author = {Miaobo Hu and Shuhao Hu and Bokun Wang and Ruohan Wang and Xin Wang and Xiaobo Guo and Daren Zha and Jun Xiao},
  journal= {arXiv preprint arXiv:2605.20722},
  year   = {2026}
}