中文

熵比裁剪作为稳定强化学习的软全局约束

机器学习 2026-04-24 v2 计算与语言

摘要

大型语言模型的后训练依赖强化学习来提升模型能力和对齐质量。然而,离策略训练范式引入了分布偏移,往往将策略推至信任区域之外,导致训练不稳定,表现为策略熵的波动和不稳定的梯度。虽然PPO-Clip通过重要性裁剪缓解了此问题,但它仍然忽略了动作的全局分布偏移。为应对这些挑战,我们提出使用当前策略与前一策略之间的熵比作为新的全局度量,有效量化策略更新过程中探索的相对变化。基于该度量,我们引入了一种熵比裁剪(Entropy Ratio Clipping, ERC)机制,对熵比施加双向约束。这在全局分布层面稳定了策略更新,并弥补了PPO-Clip无法调节未采样动作概率偏移的不足。我们将ERC集成到DAPO和GPPO两种强化学习算法中。多个基准上的实验表明,ERC持续提升性能。

关键词

引用

@article{arxiv.2512.05591,
  title  = {Entropy Ratio Clipping as a Soft Global Constraint for Stable Reinforcement Learning},
  author = {Zhenpeng Su and Leiyu Pan and Minxuan Lv and Tiehua Mei and Zijia Lin and Yuntao Li and Wenping Hu and Ruiming Tang and Kun Gai and Guorui Zhou},
  journal= {arXiv preprint arXiv:2512.05591},
  year   = {2026}
}

备注

This paper has been accepted by ACL2026