通过 On-Policy 熵流优化理解和防止 RLVR 中的熵坍缩
机器学习
2026-05-13 v1 人工智能
摘要
基于可验证奖励的强化学习 (RLVR) 已成为提升大语言模型推理能力的有效范式。然而,广泛使用的 RLVR 算法,如 GRPO,常常遭受熵坍缩的困扰,导致过早的确定性行为和优化不稳定。现有的补救措施,包括熵正则化和基于比率的裁剪启发式方法,要么以粗粒度的方式控制熵,要么依赖于近似的 on-policy 训练。在本文中,我们从词元级熵流的视角重新审视熵坍缩。我们的分析揭示,导致熵减少的词元始终多于导致熵增加的词元,从而导致严重的熵流不平衡。这一视角为现有 RLVR 算法中的熵坍缩提供了统一的解释,并强调了平衡熵动态的重要性。受此分析启发,我们提出了 On-Policy 熵流优化 (OPEFO),这是一种自适应的熵流平衡机制,根据更新对熵变化的贡献重新缩放熵增加和熵减少的更新,同时保持严格的 on-policy。在六个数学推理基准上的实验表明,OPEFO 提高了训练稳定性和最终性能。我们将在发表后发布代码和模型。
引用
@article{arxiv.2605.11491,
title = {Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization},
author = {Huimin Xu and Shuai Zhao and Xiaobao Wu and Anh Tuan Luu},
journal= {arXiv preprint arXiv:2605.11491},
year = {2026}
}