你的策略正则化器暗藏一个对手
机器学习
2024-04-29 v4 机器学习
摘要
最大熵正则化等策略正则化方法被广泛用于强化学习,以提升所学策略的鲁棒性。本文中,我们展示了这种鲁棒性如何源于对奖励函数最坏情况扰动的对冲,这些扰动由一个假想对手从有限集合中选出。利用凸对偶性,我们刻画了在 KL 与 alpha-散度正则化(包含香农与 Tsallis 熵正则化作为特例)下该对抗性奖励扰动的鲁棒集合。重要的是,可在此鲁棒集合内给出泛化保证。我们对该最坏情况奖励扰动进行了详细讨论,并给出直观的实证示例以阐明该鲁棒性及其与泛化的关系。最后,我们讨论了本分析如何补充并扩展先前关于对抗奖励鲁棒性与路径一致性最优条件的结果。
引用
@article{arxiv.2203.12592,
title = {Your Policy Regularizer is Secretly an Adversary},
author = {Rob Brekelmans and Tim Genewein and Jordi Grau-Moya and Grégoire Delétang and Markus Kunesch and Shane Legg and Pedro Ortega},
journal= {arXiv preprint arXiv:2203.12592},
year = {2024}
}
备注
Transactions on Machine Learning Research