基于异域数据的离动态逆强化学习
机器学习
2021-10-25 v1
摘要
我们提出一种用于异域逆强化学习的方法,该方法利用来自真实世界的示范数据,在模拟器中学习奖励函数。该方法背后的直觉是:奖励函数不仅应面向模仿专家,还应鼓励针对模拟器与真实世界之间动态差异进行调整的动作。为此,我们采用了广泛使用的 GAN 启发的 IRL 方法,并通过对动态差异的量化来修改其识别策略生成轨迹的判别器。判别器的训练过程可得到适用于模拟器动态的可迁移奖励函数,这一点可由推导保证。实际上,我们的方法对未利用两域之间差异的示范轨迹赋予更高奖励。通过在连续控制任务上的大量实验,我们的方法展现了有效性,并证明其对高维任务的可扩展性。
引用
@article{arxiv.2110.11443,
title = {Off-Dynamics Inverse Reinforcement Learning from Hetero-Domain},
author = {Yachen Kang and Jinxin Liu and Xin Cao and Donglin Wang},
journal= {arXiv preprint arXiv:2110.11443},
year = {2021}
}