中文

扩充KL散度的政策优化

机器学习 2025-01-28 v1 人工智能 机器学习

摘要

在深度强化学习中,政策优化方法需要处理函数逼近和离-policy 数据的重用问题。标准的政策梯度方法对离policy 数据的处理不佳,导致早期收敛和不稳定。这篇论文介绍了一种用于在重用离policy 数据时稳定政策优化的方法。其核心思想是包含一个Bregman散度,用于衡量生成数据所使用的行为政策与当前政策之间的差异,以确保在离policy 数据下进行小幅安全的政策更新。Bregman散度计算的是两个政策状态分布之间的散度,而不仅仅是动作概率之间的散度,导致了一种散度增强的表述。对Atari游戏进行的经验实验表明,在数据稀缺且重用离policy 数据成为必要的场景下,我们的方法可以优于其他最先进的深度强化学习算法。

关键词

引用

@article{arxiv.2501.15034,
  title  = {Divergence-Augmented Policy Optimization},
  author = {Qing Wang and Yingru Li and Jiechao Xiong and Tong Zhang},
  journal= {arXiv preprint arXiv:2501.15034},
  year   = {2025}
}

备注

33rd Conference on Neural Information Processing Systems (NeurIPS 2019), Vancouver, Canada