STAPO: 通过压制稀疏伪造标记来稳定 LLM 的强化学习
计算与语言
2026-05-26 v5 人工智能
摘要
强化学习 (RL) 显著性地提高了大型语言模型的推理能力,但现有的 RL 微调方法高度依赖熵正则化和重新加权等经验性技术来维持稳定性。在实际应用中,这些方法常常出现后期性能崩溃,导致推理质量下降和训练不稳定。我们识别了导致这种不稳定性的关键因素:一小部分标记(称为稀疏伪造标记,约占 0.01%),这些标记对推理结果贡献微乎其微,却因继承完整的序列级奖励而接收到不成比例的梯度更新。我们提出了一个统一的框架,用于评估标记级别优化对稀疏风险、梯度范数和熵变化的影响。基于对严重干扰优化的标记特征分析,我们提出了压制梯度扰动的“压制稀疏标记” (S2T) 机制。将该机制纳入基于组的目标后,我们提出了“稀疏标记感知策略优化” (STAPO),以促进大规模模型的稳定且有效的精炼。在使用 Qwen 1.7B、8B 和 14B 基础模型进行六项数学推理基准测试中,STAPO 在熵稳定性方面始终表现出优异性能,平均性能提升了 11.49%(=1.0,top-p=1.0)和 3.73%(=0.7,top-p=0.9),显著优于 GRPO、20-Entropy 和 JustRL。
引用
@article{arxiv.2602.15620,
title = {STAPO: Stabilizing Reinforcement Learning for LLMs by Silencing Rare Spurious Tokens},
author = {Shiqi Liu and Zeyu He and Guojian Zhan and Letian Tao and Zhilong Zheng and Jiang Wu and Yinuo Wang and Yang Guan and Kehua Sheng and Bo Zhang and Keqiang Li and Jingliang Duan and Shengbo Eben Li},
journal= {arXiv preprint arXiv:2602.15620},
year = {2026}
}