基于 Tsallis KL 散度的广义 Munchausen 强化学习
机器学习
2024-03-19 v4 人工智能
摘要
强化学习中的许多策略优化方法都引入了到前一策略的 Kullback-Leibler (KL) 散度,以防止策略变化过快。该思想最初在关于保守策略迭代的奠基性论文中提出,并由 TRPO 和 Munchausen 值迭代 (MVI) 等算法给出近似。我们延续这一工作脉络,研究一种广义 KL 散度——称为 Tsallis KL 散度——其在定义中使用了 -对数。该方法是严格的推广,因为 对应于标准 KL 散度; 提供了一系列新选项。我们刻画了在 Tsallis KL 下所学到的策略类型,并论证了 何时可能有益。为获得一种融合 Tsallis KL 正则化的实用算法,我们扩展了 MVI,它是最简单的融合 KL 正则化的方法之一。我们表明,这一广义 MVI() 在 35 个 Atari 游戏上相比标准 MVI() 取得了显著改进。
引用
@article{arxiv.2301.11476,
title = {Generalized Munchausen Reinforcement Learning using Tsallis KL Divergence},
author = {Lingwei Zhu and Zheng Chen and Matthew Schlegel and Martha White},
journal= {arXiv preprint arXiv:2301.11476},
year = {2024}
}
备注
Accepted by NeurIPS 2023