OPIRL:基于分布匹配的样本高效离线策略逆向强化学习
机器学习
2022-05-24 v2 人工智能
机器人学
摘要
在奖励工程可能繁琐的场景中,逆向强化学习(Inverse Reinforcement Learning, IRL)具有吸引力。然而,先前的 IRL 算法使用在线策略转换,这需要从当前策略中进行密集采样以实现稳定和最优的性能。这限制了 IRL 在环境交互可能变得极其昂贵的现实世界中的应用。为了解决这个问题,我们提出了离线策略逆向强化学习(Off-Policy Inverse Reinforcement Learning, OPIRL),它 (1) 采用离线策略数据分布而非在线策略,能够显著减少与环境的交互次数,(2) 学习一个可转移的平稳奖励函数,在变化的动力学下具有高泛化能力,以及 (3) 利用模式覆盖行为实现更快的收敛。我们通过实验证明,我们的方法具有显著更高的样本效率,并能泛化到新环境。我们的方法以显著更少的交互次数在策略性能基线上取得了更好或可比的结果。此外,我们凭经验表明,恢复的奖励函数能够泛化到不同的任务,而先前的方法在这些任务上容易失败。
引用
@article{arxiv.2109.04307,
title = {OPIRL: Sample Efficient Off-Policy Inverse Reinforcement Learning via Distribution Matching},
author = {Hana Hoshino and Kei Ota and Asako Kanezaki and Rio Yokota},
journal= {arXiv preprint arXiv:2109.04307},
year = {2022}
}
备注
ICRA2022