中文

为多人类模仿学习引发兼容演示

机器人学 2022-10-18 v1 人工智能 人机交互

摘要

从人类提供的演示中进行模仿学习是学习机器人操作策略的有力方法。尽管模仿学习的理想数据集是同质且低方差的——反映执行任务的单一最优方法——但自然人类行为具有很大异质性,存在若干演示任务的最优方式。这种多模态对人类用户无关紧要,任务变化表现为潜意识选择;例如,先向下伸再横向抓取物体, versus 先横向伸再向下抓取。然而,这种不匹配对交互式模仿学习构成了问题,其中多轮用户通过迭代收集新的、可能冲突的演示来改进策略。为应对演示者不兼容问题,本工作设计了一种方法用于:1)在给定基础策略时度量新演示的兼容性,以及2)从新用户主动引发更兼容的演示。在两项需要长视野、灵巧操作的仿真任务以及一项使用Franka Emika Panda机械臂的真实“食物装盘”任务中,我们表明既可以通过事后过滤识别不兼容演示,也可以应用我们的兼容性度量从新用户主动引发兼容演示,从而在仿真与真实环境中提升任务成功率。

关键词

引用

@article{arxiv.2210.08073,
  title  = {Eliciting Compatible Demonstrations for Multi-Human Imitation Learning},
  author = {Kanishk Gandhi and Siddharth Karamcheti and Madeline Liao and Dorsa Sadigh},
  journal= {arXiv preprint arXiv:2210.08073},
  year   = {2022}
}

备注

To appear at the 6th Annual Conference on Robot Learning (CoRL) 2022