中文

Minimax Exploiter:一种数据高效的竞争自我博弈方法

机器学习 2023-11-30 v1 人工智能 多智能体系统

摘要

竞争自我博弈(CSP)的近期进展已利用分布式多智能体强化学习(MARL)在 Dota 2 和星际争霸 II 等复杂博弈环境中达到甚至超越人类水平。这些方法的核心组件之一依赖于构建一个由学习智能体组成的池——包括主智能体、该智能体的过往版本以及利用者智能体(Exploiter Agents)——其中利用者智能体学习针对主智能体的反策略。这些方法的一个关键缺陷是训练系统所需的大量计算成本与真实时间,使其难以部署于视频游戏制作等高度迭代的真实场景中。本文中,我们提出 Minimax Exploiter,一种利用对手知识来利用主智能体的博弈论方法,显著提升了数据效率。我们在多种设置中验证了该方法,包括简单回合制游戏、街机学习环境以及现代视频游戏《For Honor》。Minimax Exploiter 持续优于强基线,展现出更好的稳定性与数据效率,从而形成了一种灵活且易于部署的鲁棒 CSP-MARL 方法。

关键词

引用

@article{arxiv.2311.17190,
  title  = {Minimax Exploiter: A Data Efficient Approach for Competitive Self-Play},
  author = {Daniel Bairamian and Philippe Marcotte and Joshua Romoff and Gabriel Robert and Derek Nowrouzezahrai},
  journal= {arXiv preprint arXiv:2311.17190},
  year   = {2023}
}