重新审视大型推理模型中的熵正则化
机器学习
2025-09-30 v1 人工智能
计算与语言
摘要
带有可验证奖励的强化学习(RLVR)在增强大型推理模型(LRM)的推理能力方面展现出了巨大潜力。然而,它存在一个关键问题:熵塌缩与过早收敛。朴素熵正则化是传统强化学习文献中鼓励探索的常用方法,但在 LRM 背景下却无法解决此问题。我们的分析揭示,这种失败源于 LRM 中庞大的动作空间和长轨迹,这很容易在模型不加区分地探索所有可能动作与状态时引发全局熵爆炸。为了解决这一问题,我们提出了 SIREN(SelectIve entRopy rEgularizatioN),一种将探索限制在有意义的动作与状态子集中的方法。SIREN 通过两步熵掩码机制实现这一点,该机制由 top-p 掩码和峰值熵掩码组成。此外,正则化被转化为自锚定形式以稳定训练。在五个数学基准上,SIREN 获得了优于以往熵相关 RLVR 方法的平均性能,例如在 Qwen2.5-Math-7B 上的 AIME24/25 中取得了 +6.6 的 maj@k 提升。进一步分析证实,SIREN 促进了更大的响应多样性,并将熵维持在适当水平,这有助于在整个训练过程中保持验证 pass@k。这有效缓解了 LRM 的 RLVR 中常见的过早收敛问题。
引用
@article{arxiv.2509.25133,
title = {Rethinking Entropy Regularization in Large Reasoning Models},
author = {Yuxian Jiang and Yafu Li and Guanxu Chen and Dongrui Liu and Yu Cheng and Jing Shao},
journal= {arXiv preprint arXiv:2509.25133},
year = {2025}
}