中文

基于 Tsallis KL 散度的广义 Munchausen 强化学习

机器学习 2024-03-19 v4 人工智能

摘要

强化学习中的许多策略优化方法都引入了到前一策略的 Kullback-Leibler (KL) 散度,以防止策略变化过快。该思想最初在关于保守策略迭代的奠基性论文中提出,并由 TRPO 和 Munchausen 值迭代 (MVI) 等算法给出近似。我们延续这一工作脉络,研究一种广义 KL 散度——称为 Tsallis KL 散度——其在定义中使用了 qq-对数。该方法是严格的推广,因为 q=1q = 1 对应于标准 KL 散度;q>1q > 1 提供了一系列新选项。我们刻画了在 Tsallis KL 下所学到的策略类型,并论证了 q>1q >1 何时可能有益。为获得一种融合 Tsallis KL 正则化的实用算法,我们扩展了 MVI,它是最简单的融合 KL 正则化的方法之一。我们表明,这一广义 MVI(qq) 在 35 个 Atari 游戏上相比标准 MVI(q=1q = 1) 取得了显著改进。

关键词

引用

@article{arxiv.2301.11476,
  title  = {Generalized Munchausen Reinforcement Learning using Tsallis KL Divergence},
  author = {Lingwei Zhu and Zheng Chen and Matthew Schlegel and Martha White},
  journal= {arXiv preprint arXiv:2301.11476},
  year   = {2024}
}

备注

Accepted by NeurIPS 2023