中文

估计器的喜剧:LLM 强化学习训练中的 KL 正则化

机器学习 2026-03-19 v3 人工智能

摘要

通过强化学习 (RL) 训练,大型语言模型 (LLM) 的推理性能可以得到显著提升。用于 LLM 训练的 RL 目标包含一个正则化项,即训练策略与参考策略之间的反向 Kullback-Leibler (KL) 散度。由于精确计算 KL 散度是难以处理的,实践中使用了各种估计器从同策略样本中对其进行估计。尽管 KL 散度被广泛采用(包括在多个开源库中),但目前尚无系统研究分析将 KL 估计器纳入目标函数的众多方式及其对经过 RL 训练模型的下游性能的影响。近期工作表明,纳入 KL 正则化的通行做法并未为既定目标提供正确的梯度,从而在目标与其实现之间产生了差异。在本文中,我们进一步分析了这些做法,并研究了几种估计器配置的梯度,揭示了设计选择如何塑造梯度偏差。我们通过对 \texttt{Qwen2.5-7B}、\texttt{Llama-3.1-8B-Instruct} 和 \texttt{Qwen3-4B-Instruct-2507} 进行不同配置的 RL 微调,并评估它们在分布内和分布外任务上的性能,以实证观察证实了这些发现。通过分析,我们观察到,在同策略设置中:(1) 具有偏差梯度的估计器配置可能导致训练不稳定;(2) 使用产生无偏差梯度的估计器配置可在领域内和领域外任务上获得更好的性能。我们还研究了离策略设置中不同 KL 配置产生的性能,并观察到 KL 正则化有助于稳定由异步设置产生的离策略 RL 训练。

关键词

引用

@article{arxiv.2512.21852,
  title  = {A Comedy of Estimators: On KL Regularization in RL Training of LLMs},
  author = {Vedant Shah and Johan Obando-Ceron and Vineet Jain and Brian Bartoldson and Bhavya Kailkhura and Sarthak Mittal and Glen Berseth and Pablo Samuel Castro and Yoshua Bengio and Nikolay Malkin and Moksh Jain and Siddarth Venkatraman and Aaron Courville},
  journal= {arXiv preprint arXiv:2512.21852},
  year   = {2026}
}