中文

通过好奇心探索实现灵活高效的远程规划

人工智能 2020-07-09 v2 机器人学

摘要

识别能够灵活高效地发现时间扩展多阶段规划的算法,是推进机器人技术和基于模型的强化学习的关键一步。远程规划的核心问题是找到一种有效的方法来搜索可能动作序列的树。任务与运动规划(TAMP)文献中现有的非学习规划解决方案依赖于动作的效果和前提条件的逻辑描述的存在。这一约束允许TAMP方法有效地简化树搜索问题,但限制了它们对未见和复杂物理环境的泛化能力。相比之下,深度强化学习(DRL)方法使用灵活的基于神经网络的函数逼近器来发现能够自然泛化到未见情况的策略。然而,DRL方法难以处理远程多步规划情况中固有的非常稀疏的奖励景观。在此,我们提出了好奇样本规划器(CSP),它通过将好奇心引导的采样策略与模仿学习相结合,融合了TAMP和DRL的元素以加速规划。我们表明,CSP能够高效地发现有趣且复杂的时间扩展规划,以解决各种物理上逼真的3D任务。相比之下,标准的规划和学习方法通常根本无法解决这些任务,或者只有在大量且高度可变的训练样本下才能做到。我们探索了在CSP中使用各种好奇心指标,并分析了CSP发现的解决方案类型。最后,我们表明CSP支持任务迁移,从而在执行一项任务期间学到的探索策略可以帮助提高相关任务的效率。

关键词

引用

@article{arxiv.2004.10876,
  title  = {Flexible and Efficient Long-Range Planning Through Curious Exploration},
  author = {Aidan Curtis and Minjian Xin and Dilip Arumugam and Kevin Feigelis and Daniel Yamins},
  journal= {arXiv preprint arXiv:2004.10876},
  year   = {2020}
}