观察与匹配:用正则化最优传输超级充电模仿学习
机器人学
2023-02-22 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
模仿学习在为复杂决策问题高效学习策略方面具有巨大前景。当前最先进的算法常使用逆强化学习(IRL),即在给定一组专家演示的情况下,智能体交替推断奖励函数及相应的最优策略。然而,此类 IRL 方法对于复杂控制问题常需要大量在线交互。在本工作中,我们提出正则化最优传输(ROT),一种基于最优传输轨迹匹配近期进展的新模仿学习算法。我们的关键技术洞见是,将轨迹匹配奖励与行为克隆自适应结合,即使仅用少量演示也能显著加速模仿。我们在 DeepMind Control Suite、OpenAI Robotics Suite 和 Meta-World Benchmark 上的 20 个视觉控制任务中的实验表明,相较于先前最先进方法,达到专家性能 90% 的模仿速度平均快 7.8 倍。在真实世界机器人操作中,仅凭一次演示和一小时的在线训练,ROT 在 14 个任务上实现了 90.1% 的平均成功率。
引用
@article{arxiv.2206.15469,
title = {Watch and Match: Supercharging Imitation with Regularized Optimal Transport},
author = {Siddhant Haldar and Vaibhav Mathur and Denis Yarats and Lerrel Pinto},
journal= {arXiv preprint arXiv:2206.15469},
year = {2023}
}
备注
Code and robot videos are available on https://rot-robot.github.io/