中文

MESA:通过利用状态-动作空间结构实现多智能体学习中的协作元探索

机器学习 2024-05-03 v1 人工智能 多智能体系统

摘要

多智能体强化学习(MARL)算法常常难以找到接近帕累托最优纳什均衡的策略,这很大程度上归因于缺乏高效的探索。在稀疏奖励环境中,由于策略学习表现出更大的方差,该问题进一步加剧。本文引入了 MESA,一种用于协作多智能体学习的新型元探索方法。它通过首先从训练任务中识别智能体的高回报联合状态-动作子空间,然后学习一组多样化的探索策略来“覆盖”该子空间,从而学习如何探索。这些训练好的探索策略可以与任何离策略 MARL 算法集成,用于测试时任务。我们首先在多步矩阵博弈中展示了 MESA 的优势。此外,实验表明,借助学习到的探索策略,MESA 在多个多智能体粒子环境和多智能体 MuJoCo 环境的稀疏奖励任务中取得了显著更好的性能,并展现出在测试时泛化到更具挑战性任务的能力。

关键词

引用

@article{arxiv.2405.00902,
  title  = {MESA: Cooperative Meta-Exploration in Multi-Agent Learning through Exploiting State-Action Space Structure},
  author = {Zhicheng Zhang and Yancheng Liang and Yi Wu and Fei Fang},
  journal= {arXiv preprint arXiv:2405.00902},
  year   = {2024}
}

备注

Accepted to AAMAS 2024. 15 pages