基于观测逆强化学习在次优演示之外进行外推
机器学习
2019-07-10 v5 机器学习
摘要
现有逆强化学习(IRL)方法的一个关键缺陷是它们无法显著优于演示者。这是因为 IRL 通常寻求一个使演示者看起来接近最优的奖励函数,而不是推断演示者可能在实际中执行得很差的潜在意图。在本文中,我们提出了一种新颖的从观测中学习奖励的算法——轨迹排序奖励外推(T-REX),该算法在一组(近似)排序的演示之外进行外推,以便从一组可能很差的演示中推断出高质量的奖励函数。当与深度强化学习结合时,T-REX 在多个 Atari 和 MuJoCo 基准任务上优于最先进的模仿学习和 IRL 方法,并且取得的性能通常超过最佳演示性能的两倍。我们还证明了 T-REX 对排序噪声具有鲁棒性,并且可以通过简单地观察学习者在一段时间内在任务上带噪声地进步来准确外推意图。
引用
@article{arxiv.1904.06387,
title = {Extrapolating Beyond Suboptimal Demonstrations via Inverse Reinforcement Learning from Observations},
author = {Daniel S. Brown and Wonjoon Goo and Prabhat Nagarajan and Scott Niekum},
journal= {arXiv preprint arXiv:1904.06387},
year = {2019}
}
备注
In proceedings of Thirty-sixth International Conference on Machine Learning (ICML 2019)