中文

正则化策略具有奖励鲁棒性

机器学习 2021-01-19 v1 机器学习

摘要

在强化学习(RL)中对策略进行熵正则化是一种常用的启发式方法,用于确保学习到的策略在过拟合到局部最优策略之前充分探索状态空间。使用熵的主要动机是为了探索并消除最优策略的歧义;然而其理论效应尚未被完全理解。在本工作中,我们研究更一般的正则化 RL 目标,并利用 Fenchel 对偶性;我们推导出其对偶问题,其形式为一个对抗性奖励问题。特别地,我们发现由正则化目标得到的最优策略恰恰是在最坏情况对抗性奖励下强化学习问题的一个最优策略。我们的结果使我们能够将流行的熵正则化方案重新解释为某种鲁棒化形式。此外,由于我们的结果具有一般性,我们将其应用于其他已有的正则化方案。因此,我们的结果增进了对策略正则化效应的认识,并深化了我们对通过鲁棒奖励进行探索的广泛理解。

关键词

引用

@article{arxiv.2101.07012,
  title  = {Regularized Policies are Reward Robust},
  author = {Hisham Husain and Kamil Ciosek and Ryota Tomioka},
  journal= {arXiv preprint arXiv:2101.07012},
  year   = {2021}
}