中文

从人类方向性修正中学习

机器人学 2022-08-08 v3 机器学习 系统与控制 系统与控制

摘要

本文提出一种新方法,使机器人能够从人类方向性修正中增量学习目标函数。现有方法从人类幅度修正中学习;由于人类需要仔细选择每次修正的幅度,那些方法容易导致过度修正和学习低效。所提方法仅需要人类方向性修正——仅指示输入变化方向而不指示其幅度的修正。我们仅假设每次修正,无论其幅度如何,都指向相对于未知目标函数改善机器人当前运动的方向。满足该假设的允许修正占输入空间的一半,而幅度修正必须位于收缩的水平集中。对于每次方向性修正,所提方法基于具有几何解释的割平面方法更新目标函数的估计。我们已建立理论结果以展示学习过程的收敛性。所提方法已在数值示例、两项人机游戏的用户研究以及真实四旋翼实验中测试。结果证实了所提方法的收敛性,并进一步表明该方法比最先进的机器人学习框架显著更有效(更高成功率)、高效/省力(需要更少人类修正),且可能更易用(更少早期浪费试验)。

关键词

引用

@article{arxiv.2011.15014,
  title  = {Learning from Human Directional Corrections},
  author = {Wanxin Jin and Todd D. Murphey and Zehui Lu and Shaoshuai Mou},
  journal= {arXiv preprint arXiv:2011.15014},
  year   = {2022}
}

备注

This is a preprint. The published version can be accessed at IEEE Transactions on Robotics