中文

通过 π-STAM 学习人-机器人交接:基于时空可供性图的策略改进

机器人学 2016-10-18 v2

摘要

人-机器人交接任务具有高度不确定性和问题结构差的特点,使其成为困难的任务。虽然机器学习方法已显示出有希望的结果,但它们在状态维度大的问题(例如人形机器人场景)中的应用仍然有限。此外,使用这些方法并在与人类操作员交互期间,无法保证对空间约束(例如来自社交规则)的正确解释。在本文中,我们提出了基于时空可供性图的策略改进——π-STAM,这是一种新颖的迭代算法,用于学习空间可供性并生成机器人行为。我们的目标是通过使用可供性来生成适应未知动作语义的策略。通过这种方式,在学习执行人-机器人交接任务时,我们可以(1)用少量训练回合高效地生成良好策略,以及(2)轻松编码动作语义,并在可用时强制执行其中的先验知识。我们在仿真和真实 NAO 机器人上实验验证了我们的方法,该机器人的任务是从人类手中接过物体。获得的结果表明,我们的算法在获得良好策略的同时,减少了学习过程的计算负荷和时间。

关键词

引用

@article{arxiv.1610.02609,
  title  = {Learning Human-Robot Handovers Through $\pi$-STAM: Policy Improvement With Spatio-Temporal Affordance Maps},
  author = {Francesco Riccio and Roberto Capobianco and Daniele Nardi},
  journal= {arXiv preprint arXiv:1610.02609},
  year   = {2016}
}