中文

用于质量多样性强化学习的近端策略梯度树形算法

机器学习 2024-01-31 v2 人工智能

摘要

训练具备通用能力、能彻底探索环境并学习新颖多样技能的智能体是机器人学习的长期目标。质量多样性强化学习(QD-RL)是一个新兴研究领域,它融合了两大领域的优势——质量多样性(QD)提供了一种原则性的探索形式并产生行为多样的智能体集合,而强化学习(RL)提供了一种强大的性能提升算子,可实现跨任务与动态环境的泛化。现有QD-RL方法局限于采样高效的确定性离策略RL算法和/或进化策略,并在高度随机环境中表现不佳。在本工作中,我们首次将On-policy RL,具体为近端策略优化(PPO),适配到可微质量多样性(DQD)框架,并提出相对于先前工作的额外改进,从而在具挑战性的运动任务上实现高效优化与新技能发现。我们的新算法,近端策略梯度树形算法(PPGA),取得了最先进的结果,包括在具挑战性的人形域上相较基线最佳奖励提升4倍。

关键词

引用

@article{arxiv.2305.13795,
  title  = {Proximal Policy Gradient Arborescence for Quality Diversity Reinforcement Learning},
  author = {Sumeet Batra and Bryon Tjanaka and Matthew C. Fontaine and Aleksei Petrenko and Stefanos Nikolaidis and Gaurav Sukhatme},
  journal= {arXiv preprint arXiv:2305.13795},
  year   = {2024}
}

备注

Accepted as a spotlight paper at ICLR 2024