利用 MAP-Elites 进化多样化强化学习智能体种群
神经与进化计算
2023-06-16 v2 人工智能
摘要
质量多样性(QD)已成为一种强大的替代优化范式,旨在生成大量且多样的解决方案集合,其旗舰算法 MAP-ELITES(ME)通过变异与交叉进化解决方案。尽管对某些非结构化问题非常有效,早期 ME 实现仅依赖随机搜索来进化解决方案种群,导致其在高维问题(如进化神经网络)中样本效率低下。后续工作考虑利用梯度信息引导搜索,通过借鉴黑盒优化(BBO)或强化学习(RL)的技术来解决这些缺陷。虽然将 RL 技术与 ME 结合在需要大量探索的机器人控制问题上实现了最先进性能,但也使这些 ME 变体沾染了 RL 算法常见而 ME 原本没有的局限,如超参数敏感、高随机性以及训练不稳定性,包括近期方法中因部分组件在种群间共享而随种群规模增大出现的问题。此外,现有 ME 与 RL 结合的方法往往绑定特定 RL 算法,使其无法用于对应 RL 算法失效的问题。为解决这些缺陷,我们引入一个灵活框架,允许使用任意 RL 算法,并通过进化智能体种群(其定义包含超参数与所有可学习参数)而非仅策略,来缓解上述局限。我们在若干取自 QD-RL 文献的机器人控制问题(部分含欺骗性奖励)上通过大量数值实验展示了框架带来的益处。
引用
@article{arxiv.2303.12803,
title = {Evolving Populations of Diverse RL Agents with MAP-Elites},
author = {Thomas Pierrot and Arthur Flajolet},
journal= {arXiv preprint arXiv:2303.12803},
year = {2023}
}