基于探索的集合体方法中的多样性诅咒
机器学习
2024-05-08 v1
摘要
我们在深度强化学习中发现了一种惊讶现象:训练一个数据共享的多样化集合体 -- 这一已是探索策略 -- 会显著损害单个集合体成员的性能。通过仔细分析,我们将性能下降归因于每个集合体成员在共享训练数据中自生成数据的比例偏低,以及单个集合体成员从高度离策略数据中学习的效率低下。我们因此将其命名为多样性诅咒。我们发现,诸如更大回放缓冲区或较小集合体规模等直观解决方案 -- 要么未能持续缓解性能损失,要么削弱了集合体优势。最后,我们在離散和连续控制领域展示了通过表征学习来抵消多样性诅咒的潜力,提出了一种名为 Cross-Ensemble Representation Learning (CERL) 的新方法。我们的工作为集合体探索中意外的陷阱提供了宝贵见解,并为未来此类方法的应用提出了重要警示。
引用
@article{arxiv.2405.04342,
title = {The Curse of Diversity in Ensemble-Based Exploration},
author = {Zhixuan Lin and Pierluca D'Oro and Evgenii Nikishin and Aaron Courville},
journal= {arXiv preprint arXiv:2405.04342},
year = {2024}
}
备注
Published as a conference paper at ICLR 2024