中文

非所有标记都重要:通过强化学习中的标记重要性提高 LLM 推理效率

机器学习 2026-04-20 v4 计算与语言

摘要

大语言模型 (LLMs) 显示出强大的推理能力,但常常产生不必要的冗长解释,降低效率。尽管强化学习 (RL) 用于改进推理,但大多数方法关注准确性,依赖基于长度的均匀奖励,忽视了单个标记的不同贡献,常常损害正确性。我们从标记重要性的角度重新审视 RL 中的长度优化。观察到许多链式思维 (CoT) 标记对最终答案贡献不大,我们引入一种显著性感知的长度奖励, selectively 对不显著的标记进行惩罚,以减少冗余性同时保留关键推理。我们还提出一种动态长度奖励,鼓励训练早期进行更详细的推理,并逐渐转向简洁性。将这些组件集成到标准的政策优化中,可实现一种提升推理效率和准确性的框架。跨多个基准的实验表明,该方法在保持或提高正确性的同时,显著减少了响应长度,凸显了建模标记重要性对高效 LLM 推理的重要性。

关键词

引用

@article{arxiv.2506.08125,
  title  = {Not All Tokens Matter: Towards Efficient LLM Reasoning via Token Significance in Reinforcement Learning},
  author = {Hanbing Liu and Lang Cao and Yuanyi Ren and Mengyu Zhou and Haoyu Dong and Xiaojun Ma and Shi Han and Dongmei Zhang},
  journal= {arXiv preprint arXiv:2506.08125},
  year   = {2026}
}