中文

数据高效的后见之明离策略选项学习

机器学习 2021-06-16 v2 人工智能 机器人学 机器学习

摘要

我们提出后见之明离策略选项(HO2),一种数据高效的选项学习算法。给定任意轨迹,HO2推断可能的选项选择,并通过动态规划推断过程反向传播,以离策略且端到端的方式稳健训练所有策略组件。该方法在通用基准上优于现有选项学习方法。为了更好地理解选项框架并从时间抽象与动作抽象中分离益处,我们评估了具有可比优化的扁平策略与混合策略的消融实验。结果突显了两类抽象以及离策略训练和信赖域约束的重要性,尤其是在从原始像素输入的具有挑战性的模拟3D机器人操纵任务中。最后,我们直观地调整推断步骤,以研究增加时间抽象对使用预训练选项及从零开始训练的影响。

关键词

引用

@article{arxiv.2007.15588,
  title  = {Data-efficient Hindsight Off-policy Option Learning},
  author = {Markus Wulfmeier and Dushyant Rao and Roland Hafner and Thomas Lampe and Abbas Abdolmaleki and Tim Hertweck and Michael Neunert and Dhruva Tirumala and Noah Siegel and Nicolas Heess and Martin Riedmiller},
  journal= {arXiv preprint arXiv:2007.15588},
  year   = {2021}
}

备注

Published at ICML2021