关于KL散度梯度估计在RL中的几个常见陷阱
机器学习
2025-06-12 v1
摘要
我们指出了在RL训练中使用KL散度梯度估计时存在的若干陷阱,这些陷阱在众多开源项目和论文中均有体现。第一个主要陷阱是对KL估计作为损失函数进行梯度计算。我们展示了此类实现通常是不正确的,无法产生所需的KL梯度。其次,我们指出,一些实现未考虑估计问题的序列性质,最多只能产生部分梯度。我们通过直观的tabular实验和LLM实验表明了这些问题的影响,并展示了正确的KL梯度实现方式。
引用
@article{arxiv.2506.09477,
title = {On a few pitfalls in KL divergence gradient estimation for RL},
author = {Yunhao Tang and Rémi Munos},
journal= {arXiv preprint arXiv:2506.09477},
year = {2025}
}