并非所有标记都必要(NAT):基于标记高效强化学习
机器学习
2026-03-10 v1 人工智能
摘要
强化学习(Reinforcement Learning, RL)已成为大型语言模型进展的关键驱动力,但随着对长链式思考(chain-of-thought, CoT)轨迹的扩展,受限于对每个生成标记的反向传播,规模化RL正日益受到限制。即便采用优化后的滚动引擎,完整的标记更新仍消耗大量训练成本,将标记长度转化为RL的隐性税负。我们引入“并非所有标记都必要(Not All Tokens Are Needed, NAT)”,一个统一框架,将标记预算确立为一级优化原语。NAT通过仅使用所选标记子集来更新策略,同时保留完整序列RL的学习信号。核心思想是利用Horvitz-Thompson再加权实现的无偏部分标记策略梯度估计器,确保在抽样的情况下仍具备统计正确性。我们采用两种简单、即插即用的标记选择方案:均匀随机抽样(Uniform Random Sampling, URS)和随机前缀切割(Random Prefix Cutting, RPC),两者在不修改奖励计算或滚动管道的情况下,减少前向和反向计算及内存消耗。在数学推理基准测试中,NAT在保持与完全标记GRPO相当性能的同时,使用的标记数可降至50%,为突破长轨迹所致的限制,提供了高效且正交的RL扩展路径。在实验中,RPC可节省18%的峰值GPU内存和29%的前向和反向RL训练时间。
引用
@article{arxiv.2603.06619,
title = {Not all tokens are needed(NAT): token efficient reinforcement learning},
author = {Hejian Sang and Yuanda Xu and Zhengze Zhou and Ran He and Zhipeng Wang},
journal= {arXiv preprint arXiv:2603.06619},
year = {2026}
}