中文

PlanIt:一种通过大规模偏好反馈学习路径规划的众包方法

机器人学 2016-01-06 v3 人工智能 机器学习

摘要

我们考虑在富含物体和人类的环境中学习用户对机器人轨迹的偏好问题。这是一项具有挑战性的任务,因为定义良好轨迹的标准随用户、任务和环境中的交互而变化。我们使用成本函数来表示轨迹偏好,机器人学习该函数并利用它在新环境中生成良好的轨迹。我们设计了一个众包系统——PlanIt,其中非专家用户对机器人轨迹的片段进行标记。PlanIt 使我们能够收集大量的用户反馈,并利用来自 PlanIt 的弱标签和噪声标签来学习模型参数。我们在 122 个不同的环境中测试了我们的方法,涵盖机器人导航和操作任务。大量的实验表明,学习到的成本函数能够在人类环境中生成首选轨迹。我们的众包系统已公开可用,用于可视化学习到的成本并提供偏好反馈:\url{http://planit.cs.cornell.edu}

关键词

引用

@article{arxiv.1406.2616,
  title  = {PlanIt: A Crowdsourcing Approach for Learning to Plan Paths from Large Scale Preference Feedback},
  author = {Ashesh Jain and Debarghya Das and Jayesh K Gupta and Ashutosh Saxena},
  journal= {arXiv preprint arXiv:1406.2616},
  year   = {2016}
}

备注

PlanIt Camera Ready ICRA'15