通过标准化基线和评估消除离线多智能体强化学习进展的幻象
机器学习
2024-10-31 v3 人工智能
摘要
离线多智能体强化学习(MARL)是一个新兴领域,在实际应用中前景广阔。不幸的是,离线MARL的研究现状受到基线和评估协议不一致的困扰,这最终使得准确评估进展、信任新提出的创新以及让研究人员轻松地在前人工作基础上进行构建变得困难。在本文中,我们首先通过对已发表的离线MARL工作进行代表性研究,识别出现有用于衡量新算法性能的方法中的重大缺陷。其次,通过与这些先前工作的直接比较,我们证明了简单、实现良好的基线可以在广泛的任务中取得最先进(SOTA)的结果。具体来说,我们表明,在先前工作中使用的47个数据集中,有35个(近75%的情况),我们匹配或超过了当前声称的SOTA性能。引人注目的是,我们的基线通常显著优于这些更复杂的算法。最后,我们通过引入一种简单的标准化评估方法,并提供我们在多种场景下具有统计稳健结果的基线实现(可用于未来工作的比较),来纠正从先前工作中凸显出的缺陷。我们的提议包括简单且明智、易于采纳的步骤,这些步骤与坚实的基线和比较结果相结合,可以显著提高未来离线MARL实证科学的整体严谨性。
引用
@article{arxiv.2406.09068,
title = {Dispelling the Mirage of Progress in Offline MARL through Standardised Baselines and Evaluation},
author = {Claude Formanek and Callum Rhys Tilbury and Louise Beyers and Jonathan Shock and Arnu Pretorius},
journal= {arXiv preprint arXiv:2406.09068},
year = {2024}
}
备注
Accepted at 38th Conference on Neural Information Processing Systems (NeurIPS 2024) Track on Datasets and Benchmarks