中文

分段优势估计:增强 PPO 以用于长上下文 LLM 训练

机器学习 2026-01-13 v1 人工智能

摘要

训练大型语言模型 (LLM) 以完成推理任务正日益依赖于基于可验证奖励的强化学习 (RLVR),其中提供了稳健策略更新的框架。然而,PPO 的实际应用受益于稀疏奖励 RLVR 环境中不可靠的优势估计的限制。这一问题源于 RLVR 中的稀疏奖励导致中间值预测不准确,这进而在由广义优势估计 (GAE) 每个 token 聚合时引入显著偏差。为解决这一问题,我们引入分段优势估计 (SAE),以减轻 GAE 在 RLVR 中可能产生的偏差。我们的关键洞察是,在每个 token 上聚合 n 步优势(正如 GAE 所做)是不必要的,常常会引入过度偏差,因为单个 token 承载的信息有限。相反,SAE 首先将生成的序列分区为连贯的子段,使用低概率 token 作为启发式边界。然后,仅从这些信息丰富的段过渡中选择性地计算方差降低的优势估计,有效地过滤掉中间 token 的噪声。我们的实验表明,SAE 实现了卓越的性能,在最终得分、训练稳定性和样本效率方面均取得显著的改进。这些收益在多个模型规模上保持一致,相关性分析确认,我们提出的优势估计器与近似真实优势的相关性更高,正合其卓越性能。

关键词

引用

@article{arxiv.2601.07320,
  title  = {Segmental Advantage Estimation: Enhancing PPO for Long-Context LLM Training},
  author = {Xue Gong and Qi Yi and Ziyuan Nan and Guanhua Huang and Kejiao Li and Yuhao Jiang and Ruibin Xiong and Zenan Xu and Jiaming Guo and Shaohui Peng and Bo Zhou},
  journal= {arXiv preprint arXiv:2601.07320},
  year   = {2026}
}