中文

面向机器人深度示教学习的人本采样与机本采样之比较

机器人学 2017-03-30 v3 机器学习

摘要

受机器人控制深度学习近期进展的启发,本文从获取示教数据的角度考虑了两种学习算法。“人本采样”(HC)是标准的监督学习算法,由人类监督者通过遥操作机器人执行任务,提供由状态-控制对组成的轨迹。“机本采样”(RC)是 DAgger 等算法中日益流行的替代方法,由人类监督者观察机器人执行已学习策略,并为访问的每个状态提供纠正控制标签。RC 采样对人类监督者而言可能具有挑战性且易产生误标。RC 采样还可能在策略性能中引入误差,因为它会反复访问状态空间中较难学习的区域。尽管对于线性 SVM 等标准学习模型,RC 采样学习到的策略可能优于 HC 采样,但对于深度学习和超参数决策树等具有极低模型误差的高表达力学习模型,HC 采样学习到的策略可能与之相当。我们使用网格世界和物理机器人单物体分离任务对 HC 和 RC 进行了比较,在后一任务中,输入是平面工作台上连通物体集合的二值图像,策略生成夹爪的运动以将一个物体从其余物体中分离。我们在仿真中观察到,对于线性 SVM,RC 学习到的策略优于 HC 学习到的策略,但对于深度模型,这一优势消失。我们还发现,在 RC 中,人类提供的纠正控制标签可能高度不一致。我们证明存在一类示例,在极限情况下,HC 保证收敛到最优策略,而 RC 可能无法收敛。

关键词

引用

@article{arxiv.1610.00850,
  title  = {Comparing Human-Centric and Robot-Centric Sampling for Robot Deep Learning from Demonstrations},
  author = {Michael Laskey and Caleb Chuck and Jonathan Lee and Jeffrey Mahler and Sanjay Krishnan and Kevin Jamieson and Anca Dragan and Ken Goldberg},
  journal= {arXiv preprint arXiv:1610.00850},
  year   = {2017}
}

备注

Submitted to International Conference on Robotics and Automation (ICRA) 2017