中文

遍历式模仿:从该做与不该做中学习

机器人学 2021-04-01 v1

摘要

随着多功能机器人可及性的增长,让终端用户无需编写控制策略即可教导机器人任务是有益的。一种可能是通过成功的任务执行来教导机器人。然而,近乎最优的任务演示可能难以提供,且即便成功的演示也可能未能捕捉对稳健技能复现至关重要的任务方面。在此,我们提出一种从演示中学习(LfD)的方法,其无需近乎最优的演示即可学习稳健的任务定义。我们提出了一个基于遍历度量(一种运动信息量的度量)学习任务的新型算法框架。此外,我们利用负演示——即不该做的演示——并表明它们可帮助补偿不完美的演示、减少所需演示数量,并突出关键任务要素以提升机器人表现。在一个倒立摆的的概念验证示例中,我们表明仅负演示即足以成功学习并复现一项技能。通过一项有 24 名参与者的人类受试者研究,我们表明从正演示与负演示组合(posneg)中一致能比同等数量仅正演示捕获更多关于任务的信息。最后,我们在 7-DoF Franka 机械臂的目标到达与桌面清理模拟任务上演示了我们的学习方法。我们的结果指向一个由稳健、数据高效的 LfD 赋能新手用户的未来。

关键词

引用

@article{arxiv.2103.17098,
  title  = {Ergodic imitation: Learning from what to do and what not to do},
  author = {Aleksandra Kalinowska and Ahalya Prabhakar and Kathleen Fitzsimons and Todd Murphey},
  journal= {arXiv preprint arXiv:2103.17098},
  year   = {2021}
}

备注

Kalinowska and Prabhakar contributed equally to this work