转移动态失配下的鲁棒逆强化学习
机器学习
2021-12-01 v4 机器学习
摘要
我们研究专家与学习器之间存在转移动态失配时的逆强化学习(IRL)问题。具体而言,我们考虑最大因果熵(MCE)IRL 学习器模型,并基于专家与学习器转移动态之间的 -距离,给出学习器性能退化的紧上界。借助鲁棒强化学习(Robust RL)文献中的见解,我们提出了一种鲁棒 MCE IRL 算法,这是一种应对该失配的系统性方法。最后,我们在有限和连续 MDP 问题中,通过实验证明了相较于标准 MCE IRL 算法,我们的算法在转移动态失配下具有稳定的性能。
引用
@article{arxiv.2007.01174,
title = {Robust Inverse Reinforcement Learning under Transition Dynamics Mismatch},
author = {Luca Viano and Yu-Ting Huang and Parameswaran Kamalaruban and Adrian Weller and Volkan Cevher},
journal= {arXiv preprint arXiv:2007.01174},
year = {2021}
}