中文

理解质量-多样性与深度强化学习之间的协同作用

机器学习 2023-03-14 v1 人工智能 神经与进化计算 机器人学

摘要

质量-多样性(QD)与深度强化学习(RL)之间的协同作用催生了强大的混合QD-RL算法,展现出巨大潜力,并融合了两大领域的最佳特性。然而,尽管其他RL算法取得了显著进展,先前的混合方法仅使用了单一深度RL算法(TD3)。此外,QD与RL在优化过程上存在根本差异,这将受益于更具原则性的方法。我们提出广义Actor-Critic QD-RL,一种用于QD-RL设定下actor-critic深度RL方法的统一模块化框架。该框架为在QD-RL设定中研究深度RL的洞见提供了路径,这是推动QD-RL进展的重要且高效的方式。我们引入两种新算法PGA-ME (SAC)与PGA-ME (DroQ),将深度RL的最新进展应用于QD-RL设定,并解决了现有QD-RL算法无法解决的人形环境。然而,我们也发现并非所有来自深度RL的洞见都能有效迁移至QD-RL。关键的是,本工作还表明QD-RL中的actor-critic模型通常训练不足,且无需任何额外的环境评估即可获得性能提升。

关键词

引用

@article{arxiv.2303.06164,
  title  = {Understanding the Synergies between Quality-Diversity and Deep Reinforcement Learning},
  author = {Bryan Lim and Manon Flageat and Antoine Cully},
  journal= {arXiv preprint arXiv:2303.06164},
  year   = {2023}
}