基于最优传输的观测模仿学习
机器人学
2024-10-07 v2 人工智能
机器学习
摘要
观测模仿学习(ILfO)是一种学习器仅利用观测数据、在无演示动作直接指导的情况下试图模仿专家行为的设定。本文重新审视用于模仿学习的最优传输方法,其中基于学习器与专家状态轨迹之间的 Wasserstein 距离生成奖励。我们表明,现有方法可被简化,从而无需学习模型或对抗学习即可生成奖励函数。与许多其他最先进方法不同,我们的方法可与任意 RL 算法集成,并适用于 ILfO。我们在多种连续控制任务上展示了这一简单方法的有效性,并发现其在 ILfO 设定下超越了当前最优水平,即使在仅观测到单条无动作的专家轨迹时,也能在一系列评估领域中达到专家级性能。
引用
@article{arxiv.2310.01632,
title = {Imitation Learning from Observation through Optimal Transport},
author = {Wei-Di Chang and Scott Fujimoto and David Meger and Gregory Dudek},
journal= {arXiv preprint arXiv:2310.01632},
year = {2024}
}
备注
Update to newest version, presented at RLC 2024