中文

非对称 Proximal Policy Optimization:mini-critics 提升 LLM 推理能力

机器学习 2025-10-16 v3 人工智能

摘要

近期的大语言模型强化学习 (RL4LLM) 方法避免显式使用 critic,改用平均优势基线。这一转变在于实用主义:传统价值函数在 LLM 规模下训练昂贵,且在稀疏奖励和长期推理 horizon 时常常失效。我们从架构角度重新审视这一瓶颈,引入非对称 Proximal Policy Optimization (AsyPPO),是一个简单且可扩展的框架,既恢复了 critic 的作用,又在大规模模型设置下保持高效。AsyPPO 使用一组轻量级 mini-critics,每个在不相交的 prompt 分片上训练。这种设计鼓励 diverse 同时保持 calibration,降低价值估计偏差。除了稳健的估计,AsyPPO 利用 critic 之间的不确定性来细化策略更新:(i) 在 critics 一致且梯度贡献有限的状态中屏蔽优势,(ii) 从熵正则化中过滤高发散状态,抑制伪造探索。在仅使用 5000 样本的开源数据上,AsyPPO 在多个基准上均显著提升学习稳定性和性能,优于强基线如 GRPO,在 Qwen3-4b-Base 上获得超过 6% 的性能提升,在 Qwen3-8b-Base 和 Qwen3-14b-Base 上约为 3%。这些结果凸显了架构创新对可扩展、高效算法的重要性。

关键词

引用

@article{arxiv.2510.01656,
  title  = {Asymmetric Proximal Policy Optimization: mini-critics boost LLM reasoning},
  author = {Jiashun Liu and Johan Obando-Ceron and Han Lu and Yancheng He and Weixun Wang and Wenbo Su and Bo Zheng and Pablo Samuel Castro and Aaron Courville and Ling Pan},
  journal= {arXiv preprint arXiv:2510.01656},
  year   = {2025}
}