连续协调作为终身学习的现实场景
机器学习
2021-06-15 v2 人工智能
多智能体系统
摘要
当前的深度强化学习(RL)算法仍高度任务特定,缺乏泛化到新环境的能力。而终身学(LLL)旨在通过对任务间知识的高效迁移与利用来顺序求解多个任务。尽管近年来对终身 RL 的兴趣激增,但缺乏现实的测试平台使得对 LLL 算法的稳健评估十分困难。另一方面,多智能体 RL(MARL)由于其内在的非平稳性(智能体策略随时间变化),可被视为终身 RL 的自然场景。在本文中,我们引入了一个支持零样本与少样本设置的多智能体终身学习测试平台。我们的设置基于 Hanabi——一个部分可观测、完全合作的多智能体游戏,已被证明对零样本协调具有挑战性。其巨大的策略空间使其成为终身 RL 任务理想的环境。我们评估了几种近期 MARL 方法,并在有限记忆与计算资源下对最先进的 LLL 算法进行基准测试,以揭示其优劣。这种持续学习范式还为我们提供了一种超越集中式训练的务实途径,而集中式训练是 MARL 中最常用的训练协议。我们通过实验表明,在我们设置中训练的智能体能够与未见过的智能体良好协调,且无需先前工作所做的额外假设。代码与所有预训练模型可在 https://github.com/chandar-lab/Lifelong-Hanabi 获取。
引用
@article{arxiv.2103.03216,
title = {Continuous Coordination As a Realistic Scenario for Lifelong Learning},
author = {Hadi Nekoei and Akilesh Badrinaaraayanan and Aaron Courville and Sarath Chandar},
journal= {arXiv preprint arXiv:2103.03216},
year = {2021}
}
备注
19 pages with supplementary materials. Added results for Lifelong RL methods and some future work. Accepted to ICML 2021