中文

XIRL:跨本体逆强化学习

机器人学 2021-12-14 v3 人工智能 计算机视觉与模式识别 机器学习

摘要

我们研究了视觉跨本体模仿设定,其中智能体从其他智能体(如人类)演示同一任务的视频中学习策略,但其本体存在显著差异——形状、动作、末端执行器动力学等。在这项工作中,我们证明了可以自动从跨本体演示视频中发现并学习基于视觉的奖励函数,且对这些差异具有鲁棒性。具体而言,我们提出了一种用于跨本体逆强化学习(XIRL)的自监督方法,该方法利用时间循环一致性约束来学习深度视觉嵌入,从而从多个专家智能体的离线演示视频中捕捉任务进展,每个智能体因本体差异而以不同方式执行同一任务。在我们的工作之前,从自监督嵌入产生奖励通常需要与参考轨迹对齐,而在显著本体差异下这可能难以获取。我们通过实验表明,若嵌入能感知任务进展,简单地取学习嵌入空间中当前状态与目标状态之间的负距离即可作为用强化学习训练策略的奖励。我们发现我们学习的奖励函数不仅适用于训练期间见过的本体,还能泛化到全新的本体。此外,在将真实世界人类演示迁移到模拟机器人时,我们发现XIRL比当前最佳方法具有更高的样本效率。定性结果、代码和数据集可在 https://x-irl.github.io 获取。

关键词

引用

@article{arxiv.2106.03911,
  title  = {XIRL: Cross-embodiment Inverse Reinforcement Learning},
  author = {Kevin Zakka and Andy Zeng and Pete Florence and Jonathan Tompson and Jeannette Bohg and Debidatta Dwibedi},
  journal= {arXiv preprint arXiv:2106.03911},
  year   = {2021}
}

备注

Oral Accept, CoRL '21