中文

正则化逆强化学习

机器学习 2020-12-04 v2

摘要

逆强化学习(IRL)旨在通过获取能解释专家决策的奖励函数,提升学习者模仿专家行为的能力。正则化 IRL 对学习者的策略施加强凸正则项,以避免专家行为被任意常数奖励(即退化解)所合理化。我们针对正则化 IRL 提出了可处理的求解方案及获取这些方案的实用方法。现有方法局限于最大熵 IRL 框架,使其仅能使用香农熵正则项,且所提方案在实践中不可处理。我们为所提 IRL 方法在离散与连续控制上的适用性提供了理论支撑,并在多种任务上通过实验验证了性能。

关键词

引用

@article{arxiv.2010.03691,
  title  = {Regularized Inverse Reinforcement Learning},
  author = {Wonseok Jeon and Chen-Yang Su and Paul Barde and Thang Doan and Derek Nowrouzezahrai and Joelle Pineau},
  journal= {arXiv preprint arXiv:2010.03691},
  year   = {2020}
}

备注

26 pages, 7 figures