异步智能体强化学习中的缺失旧 logits:语义不匹配及离-policy 纠正方法
机器学习
2026-05-19 v2 人工智能
摘要
异步强化学习通过解耦样本生成与策略优化来提高大型语言模型智能体的 rollout 吞吐量,但也为 PPO 风格的离-policy 纠正引入了关键故障模式。在异构训练系统中,总 importance ratio 应理想地分解为两个语义上distinct的因子:一个 training-inference 差异项,用于在同一行为策略版本下对齐推理侧与训练侧分布,以及一个 policy-staleness 项,用于约束从历史策略到当前策略的更新。我们展示,实际的异步管道由于延迟更新和部分 rollout 常常会丢失必需的历史训练侧 logits,即 old logits。这种 missing-old-logit 问题将差异修复与 staleness 纠正交织在一起,破坏了解耦纠正的预期语义,使 clipping 与 masking 阈值产生意外的相互作用。为解决此问题,我们研究了exact与approximate的纠正路径。我们提出了三种 exact old-logit 获取策略:基于快照的版本跟踪、专用的 old-logit 模型,以及通过部分 rollout 中断实现的同步,并比较了它们的系统权衡。就 approximate 纠正而言,我们专注于在 exact old logits 难以低成本恢复时,通过更合适的 approximate policy 来保持解耦纠正的优势,而不会引入额外的系统开销。基于此分析,我们采用修订后的 PPO-EWMA 方法,显著提升了训练速度和优化性能。
引用
@article{arxiv.2605.12070,
title = {Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction},
author = {Zhong Guan and Yongjian Guo and Haoran Sun and Wen Huang and Shuai Di and Likang Wu and Xiong Jun Wu and Hongke Zhao},
journal= {arXiv preprint arXiv:2605.12070},
year = {2026}
}