通过迭代改进学习机械臂的轨迹偏好
机器人学
2015-01-30 v2 人工智能
人机交互
摘要
我们考虑为操作任务学习良好轨迹的问题。由于定义良好轨迹的标准随用户、任务和环境而变化,因此该问题具有挑战性。在本文中,我们提出了一种协同在线学习框架,用于教导机器人其在物体操作任务中用户的偏好。我们方法的关键新颖之处在于对用户反馈类型的期望:人类用户无需提供最优轨迹作为训练数据,只需迭代地提供比系统当前提出的轨迹略有改进的轨迹即可。我们认为,这种协同偏好反馈比最优轨迹演示更容易从用户处获取,后者在高自由度机械臂上往往难以提供且不直观。尽管如此,我们算法的理论遗憾界与最优轨迹算法的渐近速率相匹配。我们在各种杂货结账任务上展示了算法的泛化能力,在这些任务中,偏好不仅受被操作物体的影响,还受周围环境的影响。
引用
@article{arxiv.1306.6294,
title = {Learning Trajectory Preferences for Manipulators via Iterative Improvement},
author = {Ashesh Jain and Brian Wojcik and Thorsten Joachims and Ashutosh Saxena},
journal= {arXiv preprint arXiv:1306.6294},
year = {2015}
}
备注
9 pages. To appear in NIPS 2013