超越 80/20 法则:高熵少数 Token 驱动 LLM 推理的有效强化学习
计算与语言
2025-11-14 v2 人工智能
机器学习
摘要
可验证奖励的强化学习 (RLVR) 已成为增强大语言模型 (LLM) 推理能力的强大方法,但其机制尚未得到充分理解。在本研究中,我们通过 token 熵模式的新颖视角对 RLVR 进行了开创性探索,全面分析了不同 token 如何影响推理性能。通过检查思维链 (CoT) 推理中的 token 熵模式,我们观察到只有一小部分 token 表现出高熵,这些 token 充当关键分叉点,引导模型走向多样化的推理路径。此外,研究 RLVR 训练期间熵模式的演变表明,RLVR 在很大程度上遵循基础模型的熵模式,主要调整高熵 token 的熵。这些发现凸显了高熵 token(即分叉 token)对 RLVR 的重要性。我们最终通过将策略梯度更新限制在分叉 token 上来改进 RLVR,并揭示了一个甚至超越 80/20 法则的发现:仅利用 20% 的 token,在 Qwen3-8B 基础模型上即可保持与全梯度更新相当的性能,而在 Qwen3-32B(在 AIME'25 上 +11.04,在 AIME'24 上 +7.71)和 Qwen3-14B(在 AIME'25 上 +4.79,在 AIME'24 上 +5.21)基础模型上显著超越全梯度更新,展现出强大的缩放趋势。相比之下,仅在 80% 最低熵的 token 上进行训练会导致性能显著下降。这些发现表明,RLVR 的有效性主要源于优化决定推理方向的高熵 token。总而言之,我们的结果凸显了通过 token 熵视角理解 RLVR,并利用高熵少数 token 优化 RLVR 以进一步提升 LLM 推理的潜力。
引用
@article{arxiv.2506.01939,
title = {Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning},
author = {Shenzhi Wang and Le Yu and Chang Gao and Chujie Zheng and Shixuan Liu and Rui Lu and Kai Dang and Xionghui Chen and Jianxin Yang and Zhenru Zhang and Yuqiong Liu and An Yang and Andrew Zhao and Yang Yue and Shiji Song and Bowen Yu and Gao Huang and Junyang Lin},
journal= {arXiv preprint arXiv:2506.01939},
year = {2025}
}
备注
Accepted to NeurIPS 2025. 25 pages, 17 figures, 2 tables