中文

动态词表剪枝:通过驯服尾部实现稳定的 LLM-RL

机器学习 2026-02-09 v2 人工智能 机器学习

摘要

面向大语言模型 (LLM) 的强化学习 (RL) 面临着一个根本矛盾:高吞吐量推理引擎与数值精确训练引擎之间的数值发散。尽管这些系统共享相同的参数,它们产生的概率分布却略有不同,从而造成了训练-推理不匹配。我们证明,由这种不匹配引起的对数概率发散的界随 (1p)(1-p) 缩放,其中 pp 为 token 概率。这种缩放引起了高度不对称的效应:该界对于高概率 token 消失,但对于分布尾部的低概率 token 仍然显著。被采样时,这些尾部 token 引入了系统性偏差误差,这些误差在序列上累积,从而破坏了梯度估计。我们未采用事后修正,而是提出了动态词表剪枝 (DVP),将 RL 目标约束在动态确定的“安全”词表内,以排除极端尾部。该策略以较小的有界优化偏差换取了巨大的、破坏稳定性的数值误差。我们通过展示稳定的训练在经验上验证了 DVP,并通过推导诱导偏差的严格界在理论上验证了 DVP。

关键词

引用

@article{arxiv.2512.23087,
  title  = {Dynamic Vocabulary Pruning: Stable LLM-RL by Taming the Tail},
  author = {Yingru Li and Jiawei Xu and Jiacai Liu and Yuxuan Tong and Ziniu Li and Tianle Cai and Ge Zhang and Qian Liu and Baoxiang Wang},
  journal= {arXiv preprint arXiv:2512.23087},
  year   = {2026}
}