EMA Policy Gradient:通过 EMA 锚和 Top-k KL 驯服 LLM 的强化学习
机器学习
2026-02-05 v1 人工智能
摘要
强化学习(RL)已使大语言模型(LLM)能够获得越来越复杂的推理和智能体行为。在本工作中,我们提出了两种简单且有效的技术来改进 LLM 的策略梯度算法。首先,我们将固定的锚策略替换为指数移动平均(EMA),类似于深度 Q 学习中的目标网络。其次,我们引入 Top-k KL 估计器,允许在精确 KL 与抽样 KL 之间进行灵活插值。我们推导了使用 EMA 锚的稳定性条件;此外,我们表明 Top-k KL 估计器在任意 k 值下都能产生无偏的 KL 值和无偏的梯度,同时带来精确 KL 的优势。当与 GRPO 结合使用时,两种技术(EMA-PG)将显著提升性能。在数学推理任务中,R1-distilled Qwen-1.5B 能达到 53.9% 的准确率,相较于 GRPO 的 50.8% 提升。 在智能体 RL 领域,使用 Qwen-3B 基础模型时,EMA-PG 在 7 个包含搜索引擎 Q&A 数据集中平均提升了 33.3%,包括在 HotpotQA 上从 29.7% 提升至 44.1%,在 2WikiMultiHopQA 上从 27.4% 提升至 40.1%。总体而言,我们表明 EMA-PG 是一种简单、原则且强大的 LLM 规模化强化学习方法。代码:https://github.com/LunjunZhang/ema-pg
引用
@article{arxiv.2602.04417,
title = {EMA Policy Gradient: Taming Reinforcement Learning for LLMs with EMA Anchor and Top-k KL},
author = {Lunjun Zhang and Jimmy Ba},
journal= {arXiv preprint arXiv:2602.04417},
year = {2026}
}