中文

基于梯度保持视角的 RLVR 中的灵活熵控制

机器学习 2026-05-11 v2 人工智能 计算与语言

摘要

强化学习可验证奖励 (RLVR) 作为提升大型语言模型 (LLM) 推理能力的关键方法日益受到关注。然而,持续训练常导致策略熵崩溃,即熵迅速下降,导致过度自信、输出多样性降低以及梯度范数消失,进而抑制学习。梯度保持裁剪是影响这些动态的主要因素,但现有缓解策略大多为静态,缺乏将裁剪机制与精确熵控制相联系的框架。本文从梯度保持裁剪的角度出发,提出重塑 RL 中熵控制的方法。我们首先理论和实证地验证了特定重要抽样比区域对熵增减的贡献。基于这些发现,我们引入一种新型调节机制,利用动态裁剪阈值精确管理熵。此外,我们设计并评估了动态熵控制策略,包括先增后减、先减后增后减以及振荡衰减。实验结果表明,这些策略有效缓解了熵崩溃,在多个基准测试中实现了卓越的性能。

关键词

引用

@article{arxiv.2602.09782,
  title  = {Flexible Entropy Control in RLVR with a Gradient-Preserving Perspective},
  author = {Kun Chen and Peng Shi and Fanfan Liu and Haibo Qiu and Zhixiong Zeng and Siqi Yang and Wenji Mao},
  journal= {arXiv preprint arXiv:2602.09782},
  year   = {2026}
}

备注

https://github.com/Kwen-Chen/Flexible-Entropy-Control