何时能样本高效地学习具有大量参与者的通用和马尔可夫博弈?
机器学习
2022-04-01 v2 计算机科学与博弈论
机器学习
摘要
多智能体强化学习在求解具有大量参与者的博弈方面取得了实质性的经验进展。然而在理论上,由于在通用和博弈中寻找纳什均衡的最佳已知样本复杂度因联合动作空间的大小而随参与者数量指数级增长,并且存在匹配的指数下界。本文研究了在具有 步、 个状态和每个参与者 个动作的 参与者通用和马尔可夫博弈设定中,哪些学习目标具有更好的样本复杂度。首先,我们设计了在 轮内学习 -粗相关均衡(CCE),以及在 轮内学习 -相关均衡(CE)的算法。这是首条关于学习 CCE 和 CE 且样本复杂度关于 多项式级的结论。我们用于学习 CE 的算法集成了一个最小化加权交换遗憾的对抗式赌博机子程序,以及外循环中的若干新颖设计。其次,我们考虑马尔可夫势博弈这一重要特例,并设计了一种在 轮内(仅突出对 、 和 的依赖时)学习 -近似纳什均衡的算法,其仅线性依赖于 ,并在 依赖上显著优于现有高效算法。总体而言,我们的结果揭示了博弈的哪些均衡或结构假设可能实现多参与者下的样本高效学习。
引用
@article{arxiv.2110.04184,
title = {When Can We Learn General-Sum Markov Games with a Large Number of Players Sample-Efficiently?},
author = {Ziang Song and Song Mei and Yu Bai},
journal= {arXiv preprint arXiv:2110.04184},
year = {2022}
}