中文

转移动态失配下的鲁棒逆强化学习

机器学习 2021-12-01 v4 机器学习

摘要

我们研究专家与学习器之间存在转移动态失配时的逆强化学习(IRL)问题。具体而言,我们考虑最大因果熵(MCE)IRL 学习器模型,并基于专家与学习器转移动态之间的 1\ell_1-距离,给出学习器性能退化的紧上界。借助鲁棒强化学习(Robust RL)文献中的见解,我们提出了一种鲁棒 MCE IRL 算法,这是一种应对该失配的系统性方法。最后,我们在有限和连续 MDP 问题中,通过实验证明了相较于标准 MCE IRL 算法,我们的算法在转移动态失配下具有稳定的性能。

关键词

引用

@article{arxiv.2007.01174,
  title  = {Robust Inverse Reinforcement Learning under Transition Dynamics Mismatch},
  author = {Luca Viano and Yu-Ting Huang and Parameswaran Kamalaruban and Adrian Weller and Volkan Cevher},
  journal= {arXiv preprint arXiv:2007.01174},
  year   = {2021}
}