中文

学习与复用基元行为以提升后见之明经验回放的样本效率

机器人学 2023-11-21 v2 人工智能

摘要

后见之明经验回放(HER)是强化学习(RL)中使用的一项技术,已被证明能高效训练基于离策略 RL 的智能体利用稀疏奖励解决基于目标的机器人操作任务。尽管 HER 通过从过往经验中的错误学习提升了基于 RL 的智能体的样本效率,但它在环境探索时并不提供任何引导。这导致由于使用该回放策略训练智能体所需经验量巨大,训练时间非常长。在本文中,我们提出一种方法,利用先前已学会用于解决简单任务的基元行为,在探索期间引导智能体朝向更具回报的动作,同时学习其他更复杂的任务。然而,该引导并非由人工设计的课程执行,而是借助一个评论家网络在每个时间步决定是否采用由已学基元策略提出的动作。我们在若干积木操作任务中将该方法的性能与 HER 及该算法的其他更高效变体进行比较评估。我们证明,在使用我们所提方法时,智能体无论就样本效率还是计算时间都能更快地学到成功策略。代码见 https://github.com/franroldans/qmp-her。

关键词

引用

@article{arxiv.2310.01827,
  title  = {Learning and reusing primitive behaviours to improve Hindsight Experience Replay sample efficiency},
  author = {Francisco Roldan Sanchez and Qiang Wang and David Cordova Bulens and Kevin McGuinness and Stephen Redmond and Noel O'Connor},
  journal= {arXiv preprint arXiv:2310.01827},
  year   = {2023}
}

备注

6 pages, 2 figures, 1 algorithm, 1 table. Version accepted to ICARA 2024