Google Research Football 多智能体场景的实证研究
机器学习
2024-02-21 v1 多智能体系统
摘要
少数关于 Google Research Football (GRF) 的多智能体强化学习 (MARL) 研究关注 11v11 多智能体整场对战场景,据我们所知,该场景尚无公开基准发布。在本工作中,我们填补了这一空白,提供了基于种群的 MARL 训练流程以及多智能体足球场景的超参数设置,可在 200 万步内从零开始击败难度 1.0 的内置 bot。我们的实验为 Independent Proximal Policy Optimization (IPPO)(一种最先进的多智能体强化学习算法,其中每个智能体尝试在各种训练配置下独立最大化自身策略)的预期性能提供了参考。同时,我们开源了训练框架 Light-MALib,它通过分布式与异步化实现扩展了 MALib 代码库,并附带用于足球比赛的额外分析工具。最后,我们提供了利用基于种群的训练构建强足球 AI 的指引,并发布了多种预训练策略用于基准测试。我们的目标是为社区中任何在 GRF 上试验其工作的人员提供起点,以及一个简单易用的基于种群的训练框架,以通过自博弈进一步提升其智能体。实现代码见 https://github.com/Shanghai-Digital-Brain-Laboratory/DB-Football。
引用
@article{arxiv.2305.09458,
title = {An Empirical Study on Google Research Football Multi-agent Scenarios},
author = {Yan Song and He Jiang and Zheng Tian and Haifeng Zhang and Yingping Zhang and Jiangcheng Zhu and Zonghong Dai and Weinan Zhang and Jun Wang},
journal= {arXiv preprint arXiv:2305.09458},
year = {2024}
}