中文

通过迭代改进学习机械臂的轨迹偏好

机器人学 2015-01-30 v2 人工智能 人机交互

摘要

我们考虑为操作任务学习良好轨迹的问题。由于定义良好轨迹的标准随用户、任务和环境而变化,因此该问题具有挑战性。在本文中,我们提出了一种协同在线学习框架,用于教导机器人其在物体操作任务中用户的偏好。我们方法的关键新颖之处在于对用户反馈类型的期望:人类用户无需提供最优轨迹作为训练数据,只需迭代地提供比系统当前提出的轨迹略有改进的轨迹即可。我们认为,这种协同偏好反馈比最优轨迹演示更容易从用户处获取,后者在高自由度机械臂上往往难以提供且不直观。尽管如此,我们算法的理论遗憾界与最优轨迹算法的渐近速率相匹配。我们在各种杂货结账任务上展示了算法的泛化能力,在这些任务中,偏好不仅受被操作物体的影响,还受周围环境的影响。

关键词

引用

@article{arxiv.1306.6294,
  title  = {Learning Trajectory Preferences for Manipulators via Iterative Improvement},
  author = {Ashesh Jain and Brian Wojcik and Thorsten Joachims and Ashutosh Saxena},
  journal= {arXiv preprint arXiv:1306.6294},
  year   = {2015}
}

备注

9 pages. To appear in NIPS 2013