从零开始学习踢足球:通过课程学习与竞争实现样本高效的自发协调
机器学习
2021-03-10 v1 多智能体系统
摘要
本工作提出了一种能够以样本高效方式学习复杂多智能体行为的方案,应用于2v2足球。该问题被建模为马尔可夫博弈,并使用深度强化学习求解。我们提出了TD3的基本多智能体扩展,以去中心化方式学习每个玩家的策略。为简化学习,2v2足球任务被划分为三个阶段:1v0、1v1和2v2。多智能体阶段(1v1和2v2)的学习过程使用在前一阶段训练的智能体作为固定对手。此外,我们提出使用经验共享,一种将前一阶段训练的固定对手的经验分享给当前学习智能体进行训练的方法,以及一种帧跳过形式,以显著提升性能。我们的结果表明,采用我们的方法仅需不到40M次交互即可获得高质量的足球玩法。所得游戏玩的摘要视频可在 https://youtu.be/f25l1j1U9RM 找到。
引用
@article{arxiv.2103.05174,
title = {Learning to Play Soccer From Scratch: Sample-Efficient Emergent Coordination through Curriculum-Learning and Competition},
author = {Pavan Samtani and Francisco Leiva and Javier Ruiz-del-Solar},
journal= {arXiv preprint arXiv:2103.05174},
year = {2021}
}