理解质量-多样性与深度强化学习之间的协同作用
机器学习
2023-03-14 v1 人工智能
神经与进化计算
机器人学
摘要
质量-多样性(QD)与深度强化学习(RL)之间的协同作用催生了强大的混合QD-RL算法,展现出巨大潜力,并融合了两大领域的最佳特性。然而,尽管其他RL算法取得了显著进展,先前的混合方法仅使用了单一深度RL算法(TD3)。此外,QD与RL在优化过程上存在根本差异,这将受益于更具原则性的方法。我们提出广义Actor-Critic QD-RL,一种用于QD-RL设定下actor-critic深度RL方法的统一模块化框架。该框架为在QD-RL设定中研究深度RL的洞见提供了路径,这是推动QD-RL进展的重要且高效的方式。我们引入两种新算法PGA-ME (SAC)与PGA-ME (DroQ),将深度RL的最新进展应用于QD-RL设定,并解决了现有QD-RL算法无法解决的人形环境。然而,我们也发现并非所有来自深度RL的洞见都能有效迁移至QD-RL。关键的是,本工作还表明QD-RL中的actor-critic模型通常训练不足,且无需任何额外的环境评估即可获得性能提升。
引用
@article{arxiv.2303.06164,
title = {Understanding the Synergies between Quality-Diversity and Deep Reinforcement Learning},
author = {Bryan Lim and Manon Flageat and Antoine Cully},
journal= {arXiv preprint arXiv:2303.06164},
year = {2023}
}