通过引入约定来增强 Hanabi 多智能体合作中的行动空间
多智能体系统
2025-05-27 v3 人工智能
机器学习
摘要
卡牌游戏 Hanabi 被认为是测试和开发多智能体强化学习 (MARL) 算法的强大 medium,由于其合作性、部分可观测性、有限通信以及显著的复杂性。以往的研究主要聚焦于在 Hanabi 中探索 MARL 算法的能力,重点在于高级架构设计和算法操作,以实现各种合作者数量的 SOTA 性能。然而,这往往导致复杂的解决方案策略,具有高计算成本,需要大量训练数据。人类要有效地解决 Hanabi 游戏,需要使用约定,这些约定常常允许基于预定义且相互确认的"规则"或原则来隐式传递想法或知识。在本文中,我们提出了一种新方法,通过引入约定来增强智能体的行动空间,这些约定作为一系列特殊的合作动作,跨越多个时间步和多个智能体,要求智能体主动选择以实现其实现。这些约定基于人类约定,结果在 Hanabi 中的自我玩耍和跨玩耍中显著提高了各种合作者数量的性能。
引用
@article{arxiv.2412.06333,
title = {Augmenting the action space with conventions to improve multi-agent cooperation in Hanabi},
author = {F. Bredell and H. A. Engelbrecht and J. C. Schoeman},
journal= {arXiv preprint arXiv:2412.06333},
year = {2025}
}
备注
This paper is accepted and published in the journal of autonomous agents and multi-agent systems (JAAMAS). The updated manuscript is the revised version after the final round of peer revision