中文

从离线人类演示中学习机器人操作的关键要素

机器人学 2021-09-28 v2 人工智能 机器学习

摘要

模仿人类演示是赋予机器人多种操作能力的一种有前景的方法。尽管模仿学习与批量(离线)强化学习近期取得进展,但缺乏开源人类数据集与可复现的学习方法使得评估该领域现状十分困难。在本文中,我们对五种模拟与三种真实世界、复杂度各异的多阶段操作任务,以及质量各异的数据集,开展了六种离线学习算法的广泛研究。我们的研究分析了从离线人类数据学习操作时所面临的最关键挑战。基于该研究,我们得出一系列经验,包括对不同的算法设计选择的敏感性、对演示质量的依赖,以及由于训练与评估中不同目标所导致的基于停止准则的变异性。我们还强调了从人类数据集学习的机遇,例如能在超越当前强化学习方法范围的高难度多阶段任务上学习熟练策略,以及能轻松扩展到仅有原始感官信号可用的自然真实世界操作场景。我们已开源数据集与所有算法实现,以促进未来研究及基于人类演示数据学习的公平比较。代码库、数据集、训练模型等详见 https://arise-initiative.github.io/robomimic-web/

关键词

引用

@article{arxiv.2108.03298,
  title  = {What Matters in Learning from Offline Human Demonstrations for Robot Manipulation},
  author = {Ajay Mandlekar and Danfei Xu and Josiah Wong and Soroush Nasiriany and Chen Wang and Rohun Kulkarni and Li Fei-Fei and Silvio Savarese and Yuke Zhu and Roberto Martín-Martín},
  journal= {arXiv preprint arXiv:2108.03298},
  year   = {2021}
}

备注

CoRL 2021 (Oral)