中文

用于机器人操作中自动目标发现的非对称自博弈

机器学习 2021-03-09 v1 人工智能 计算机视觉与模式识别 机器人学

摘要

我们训练了一个单一的目标条件策略,可解决许多机器人操作任务,包括具有先前未见目标与物体的任务。我们依赖非对称自博弈进行目标发现,其中两个智能体 Alice 与 Bob 进行博弈。Alice 被要求提出具有挑战性的目标,Bob 旨在解决它们。我们表明该方法可在无任何人类先验的情况下发现高度多样且复杂的目标。Bob 仅能以稀疏奖励训练,因为 Alice 与 Bob 之间的交互形成了自然课程,且 Bob 可从被重新标记为以目标为条件的演示的 Alice 轨迹中学习。最后,我们的方法可扩展,产生一个能泛化至许多未见任务(如摆桌、堆叠方块与解简单谜题)的单一策略。所学策略的视频见 https://robotics-self-play.github.io。

关键词

引用

@article{arxiv.2101.04882,
  title  = {Asymmetric self-play for automatic goal discovery in robotic manipulation},
  author = {OpenAI OpenAI and Matthias Plappert and Raul Sampedro and Tao Xu and Ilge Akkaya and Vineet Kosaraju and Peter Welinder and Ruben D'Sa and Arthur Petron and Henrique P. d. O. Pinto and Alex Paino and Hyeonwoo Noh and Lilian Weng and Qiming Yuan and Casey Chu and Wojciech Zaremba},
  journal= {arXiv preprint arXiv:2101.04882},
  year   = {2021}
}

备注

Videos are shown at https://robotics-self-play.github.io