中文

无需演示数据从演示中学习

机器学习 2021-06-18 v1 机器人学

摘要

最先进的强化学习(RL)算法存在样本复杂度高的问题,尤其在稀疏奖励情形下。缓解该问题的一种流行策略是通过模仿一组专家演示来学习控制策略。此类方法的缺陷在于需要专家提供演示,而实践中这可能代价高昂。为弥补这一不足,我们提出演示发现的概率规划(P2D2),一种无需专家访问即可自动发现演示的技术。我们将发现演示表述为一个搜索问题,并利用广泛使用的规划算法(如快速扩展随机树)来寻找演示轨迹。这些演示用于初始化策略,随后由通用 RL 算法精炼。我们提供了 P2D2 能找到成功轨迹的理论保证,以及其采样复杂度的界。我们通过实验证明,该方法在一系列经典控制与机器人任务上优于经典与内在探索 RL 技术,仅需要一小部分探索样本并取得了更好的渐近性能。

关键词

引用

@article{arxiv.2106.09203,
  title  = {Learning from Demonstration without Demonstrations},
  author = {Tom Blau and Gilad Francis and Philippe Morere},
  journal= {arXiv preprint arXiv:2106.09203},
  year   = {2021}
}

备注

International Conference on Robotics and Automation (ICRA), 2021. arXiv admin note: substantial text overlap with arXiv:2001.06940