中文

诊断 LLM 强化学习中的训练-推断不匹配

机器学习 2026-05-15 v1 人工智能 计算与语言

摘要

现代大型语言模型(LLM)强化学习系统将 rollout 生成与策略优化分离。这两个阶段预期在相同模型权重下为相同序列分配相同 token 概率。然而,实现差异可能导致它们对相同序列赋予不同的值,从而引发训练-推断不匹配(TIM)。TIM 难以诊断,因为它与离策略漂移和常见稳定机制相互交织。在本工作中,我们在零不匹配诊断环境(VeXact)中隔离 TIM,表明小的 token 级数值不一致可独立导致训练崩溃。我们进一步表明,TIM 会改变有效优化问题的性质,并识别出一组可缓解 TIM 的方法。我们的结果表明,TIM 不是良性数值噪声,而是一个系统层面的扰动,应被视为分析 LLM 强化学习稳定性的第一因素。

关键词

引用

@article{arxiv.2605.14220,
  title  = {Diagnosing Training Inference Mismatch in LLM Reinforcement Learning},
  author = {Tianle Zhong and Neiwen Ling and Yifan Pi and Zijun Wei and Tianshu Yu and Geoffrey Fox and Peng Wu and Xiao Yu},
  journal= {arXiv preprint arXiv:2605.14220},
  year   = {2026}
}