C-Planning:一种用于学习目标到达任务的自动课程
机器学习
2021-10-26 v1 人工智能
摘要
目标条件强化学习 (RL) 能够解决包括导航与操控在内的广泛领域任务,但学习到达远距离目标仍是该领域的核心挑战。在没有任何离线数据、专家演示和奖励塑形的前提下,学习到达此类目标尤为困难。本文中,我们提出一种算法,通过在训练时利用搜索自动生成中间状态课程来解决远距离目标到达任务。我们的算法 Classifier-Planning (C-Planning) 将目标条件策略的学习框架为期望最大化:E 步对应使用图搜索规划最优路点序列,而 M 步旨在学习一个目标条件策略以到达这些路点。与先前将目标条件 RL 与图搜索结合的方法不同,我们的方法仅在训练而非测试时进行搜索,显著降低了部署所学策略的计算成本。实证上,我们证明了我们的方法比先前方法具有更高的样本效率。此外,它能够解决极长视野的操控与导航任务,而先前的目标条件方法与基于图搜索的方法均无法解决这些任务。
引用
@article{arxiv.2110.12080,
title = {C-Planning: An Automatic Curriculum for Learning Goal-Reaching Tasks},
author = {Tianjun Zhang and Benjamin Eysenbach and Ruslan Salakhutdinov and Sergey Levine and Joseph E. Gonzalez},
journal= {arXiv preprint arXiv:2110.12080},
year = {2021}
}