中文

用于并发发现复合策略与可组合策略的分层强化学习

机器人学 2019-08-02 v2 人工智能 机器学习

摘要

处理复杂任务昂贵强化学习(RL)的一种常见策略是将其分解为一组子任务,这些子任务通常更易于学习且可复用于新问题。然而,当机器人学习这些子任务的策略时,常见方法将每个策略学习过程分开对待。因此,所有个体(可组合)策略都需先被学会,才能通过策略组合处理复杂任务的学习过程。此外,这种个体策略的组合通常是顺序执行的,不适用于需要并发执行子任务的任务。本文中,我们提出使用一组激活向量组合对应于这些子任务的一组可组合高斯策略,从而得到一种复杂高斯策略,它是可组合策略的均值与协方差矩阵的函数。进而,我们提出一种算法,通过利用由复合策略生成的离策略数据,在同一学习过程中同时学习复合策略与可组合策略。该算法建立在最大熵 RL 方法之上,以在学习过程中促进探索。实验结果表明,利用复合策略收集的经验不仅可解决复杂任务,还能获得在其相应子任务中成功执行的有用可组合策略。

关键词

引用

@article{arxiv.1905.09668,
  title  = {Hierarchical Reinforcement Learning for Concurrent Discovery of Compound and Composable Policies},
  author = {Domingo Esteban and Leonel Rozo and Darwin G. Caldwell},
  journal= {arXiv preprint arXiv:1905.09668},
  year   = {2019}
}

备注

Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2019)