DDCO:基于示教的机器人学习中深度连续选项的发现
机器人学
2018-02-01 v2
摘要
选项(option)是一种短期技能,由针对状态空间特定区域的策略以及识别离开该区域的终止条件组成。在先前的工作中,我们提出了一种名为深度选项发现(Deep Discovery of Options, DDO)的算法,用于发现选项以加速 Atari 游戏中的强化学习。本文研究了其在机器人模仿学习中的扩展,称为深度连续选项发现(Discovery of Deep Continuous Options, DDCO),该方法从示教数据中学习由深度神经网络参数化的底层连续控制技能。我们对 DDO 进行了两项扩展:(1) 一种混合分类 - 连续分布模型,用于参数化高层策略,使其既能调用离散选项又能执行连续控制动作;(2) 一种交叉验证方法,放宽了 DDO 要求用户指定待发现选项数量的限制。我们在垂直平面内推带有摩擦和重力方块的三连杆机器人仿真中评估了 DDCO,并在 da Vinci 手术机器人上进行了两项物理实验:针头插入(抓取针头并插入硅胶组织模体)和针头分拣(从一堆针头和销钉中抓取并分类到 bins 中)。在三连杆机械臂仿真中,结果表明,与基线模仿学习方法相比,DDCO 仅需 1/3 的示教数据即可达到相同的奖励。在针头插入任务中,DDCO 的成功率为 8/10,而次优的模仿学习基线为 6/10。在手术分拣任务中,学习到的策略在 99 次尝试抓取中成功抓取单个物体 66 次,且除一次外,所有失败的抓取均通过第二次重试成功恢复。
引用
@article{arxiv.1710.05421,
title = {DDCO: Discovery of Deep Continuous Options for Robot Learning from Demonstrations},
author = {Sanjay Krishnan and Roy Fox and Ion Stoica and Ken Goldberg},
journal= {arXiv preprint arXiv:1710.05421},
year = {2018}
}
备注
Published at CoRL 2017