中文

i-Sim2Real:紧密人机交互回路中机器人策略的强化学习

机器人学 2022-11-23 v4

摘要

仿真到实物的迁移是机器人强化学习的强大范式。在仿真中训练策略的能力使得能够以低成本快速进行安全探索和大规模数据收集。然而,先前关于机器人策略仿真到实物迁移的工作通常不涉及任何人机交互,因为精确模拟人类行为是一个开放问题。本工作中,我们的目标是利用仿真的力量训练在部署时擅长与人类交互的机器人策略。但存在一个鸡生蛋蛋生鸡的问题——如何收集人类与物理机器人交互的示例,以便在仿真中建模人类行为,而此时还没有能够与人类交互的机器人?我们提出的方法,迭代式仿真到实物 (i-S2R),试图解决此问题。i-S2R 从简单的人类行为模型启动,并在仿真中训练与在真实世界中部署之间交替。在每次迭代中,人类行为模型和策略都被精炼。所有训练我们均采用一种称为黑箱梯度感知 (BGS) 的新进化搜索算法。我们在一个真实世界的机器人乒乓球环境中评估我们的方法,其中机器人的目标是与人类玩家尽可能长久地协作玩耍。乒乓球是一项高速、动态的任务,要求两名玩家对彼此的动作快速反应,从而成为人机交互研究的一个具有挑战性的测试平台。我们展示了一个工业机械臂能够与人类玩家协作打乒乓球的成果,平均实现 22 次连续击球,最好为 150 次。此外,对于 80% 的玩家,回合长度比仿真到实物加微调 (S2R+FT) 基线长 70% 至 175%。有关我们系统运行的视频,请参见 https://sites.google.com/view/is2r。

关键词

引用

@article{arxiv.2207.06572,
  title  = {i-Sim2Real: Reinforcement Learning of Robotic Policies in Tight Human-Robot Interaction Loops},
  author = {Saminda Abeyruwan and Laura Graesser and David B. D'Ambrosio and Avi Singh and Anish Shankar and Alex Bewley and Deepali Jain and Krzysztof Choromanski and Pannag R. Sanketi},
  journal= {arXiv preprint arXiv:2207.06572},
  year   = {2022}
}

备注

8+24 pages