基于子博弈课程学习加速零和博弈中的多智能体强化学习
机器学习
2023-12-19 v3
摘要
在复杂零和博弈中使用多智能体强化学习(MARL)学习纳什均衡(NE)可能极其耗费计算资源。课程学习是一种加速学习的有效方法,但生成课程的一个未被充分探索的维度是子博弈(即从特定状态出发所诱导出的博弈)的学习难度。本文提出了一种面向零和博弈的新型子博弈课程学习框架。该框架采用自适应初始状态分布,将智能体重置到某些先前访问过的状态,使其能快速学习以提升性能。在此框架基础上,我们推导出一个近似于到 NE 值平方距离的子博弈选择度量,并进一步采用基于粒子的状态采样器来生成子博弈。整合这些技术得到了我们的新算法——子博弈自动课程学习(SACL),它是该子博弈课程学习框架的一种实现。SACL 可与任意 MARL 算法(如 MAPPO)结合使用。在粒子世界环境和 Google Research Football 环境中的实验表明,SACL 比基线方法产生了更强的策略。在具有挑战性的捉迷藏象限环境中,SACL 生成了全部四个涌现阶段,且仅使用了自博弈 MAPPO 一半的样本量。项目网站位于 https://sites.google.com/view/sacl-rl。
引用
@article{arxiv.2310.04796,
title = {Accelerate Multi-Agent Reinforcement Learning in Zero-Sum Games with Subgame Curriculum Learning},
author = {Jiayu Chen and Zelai Xu and Yunfei Li and Chao Yu and Jiaming Song and Huazhong Yang and Fei Fang and Yu Wang and Yi Wu},
journal= {arXiv preprint arXiv:2310.04796},
year = {2023}
}