中文

路径积分引导策略搜索

机器人学 2018-10-15 v2 机器学习

摘要

我们提出了一种策略搜索方法,用于学习将高维感知输入映射为电机扭矩的复杂反馈控制策略,适用于具有不连续接触动力学的操作任务。我们建立在一种称为引导策略搜索 (guided policy search, GPS) 的先前技术之上,该技术迭代地优化针对特定任务实例的一组局部策略,并利用这些策略来训练可在不同任务实例间泛化的复杂高维全局策略。我们从以下几个方面扩展了 GPS:(1) 我们提出使用基于路径积分随机最优控制 (PI2) 的无模型局部优化器,使我们能够为具有高度不连续接触动力学的任务学习局部策略;(2) 我们通过使用同策略采样,使 GPS 能够在每次迭代中基于一组新的任务实例进行训练:这增加了策略训练所基于的实例的多样性,对于实现良好的泛化能力至关重要。我们表明,这些贡献使我们能够学习直接从视觉输入执行扭矩控制的深度神经网络策略。我们在具有挑战性的开门任务和拾放任务上验证了该方法,并证明我们的方法在这些任务上显著优于先前基于 LQR 的局部策略优化器。此外,我们表明同策略采样显著提高了这些策略的泛化能力。

关键词

引用

@article{arxiv.1610.00529,
  title  = {Path Integral Guided Policy Search},
  author = {Yevgen Chebotar and Mrinal Kalakrishnan and Ali Yahya and Adrian Li and Stefan Schaal and Sergey Levine},
  journal= {arXiv preprint arXiv:1610.00529},
  year   = {2018}
}

备注

Published at the International Conference on Robotics and Automation (ICRA), 2017