中文

关于KL散度梯度估计在RL中的几个常见陷阱

机器学习 2025-06-12 v1

摘要

我们指出了在RL训练中使用KL散度梯度估计时存在的若干陷阱,这些陷阱在众多开源项目和论文中均有体现。第一个主要陷阱是对KL估计作为损失函数进行梯度计算。我们展示了此类实现通常是不正确的,无法产生所需的KL梯度。其次,我们指出,一些实现未考虑估计问题的序列性质,最多只能产生部分梯度。我们通过直观的tabular实验和LLM实验表明了这些问题的影响,并展示了正确的KL梯度实现方式。

关键词

引用

@article{arxiv.2506.09477,
  title  = {On a few pitfalls in KL divergence gradient estimation for RL},
  author = {Yunhao Tang and Rémi Munos},
  journal= {arXiv preprint arXiv:2506.09477},
  year   = {2025}
}