打破多主体诅咒:基于函数逼近的可证明高效去中心化多智能体强化学习
机器学习
2023-03-03 v2 人工智能
计算机科学与博弈论
多智能体系统
机器学习
摘要
多智能体强化学习(MARL)中的一个独特挑战是多主体诅咒,即博弈的描述长度以及许多现有学习算法的复杂度随智能体数量呈指数级增长。尽管近期工作在表格型马尔可夫博弈模型下成功应对了这一挑战,但其机制严重依赖于状态数量有限且较小,无法扩展到具有巨大状态空间、必须使用函数逼近来近似价值函数或策略的实际场景。本文提出了首个在函数逼近下可证明解决多主体诅咒的 MARL 算法系列。我们设计了一种新的去中心化算法——带策略重放的 V-Learning,该算法给出了在去中心化线性函数逼近下学习马尔可夫博弈近似粗相关均衡(CCE)的首个多项式样本复杂度结果。我们的算法始终输出马尔可夫 CCE,并以 的最优速率找到 -最优解。此外,在限定为表格情形时,我们的结果优于当前寻找马尔可夫 CCE 的最佳去中心化结果 。我们进一步提出了一种替代算法——去中心化乐观策略镜像下降,该算法使用多项式数量的样本找到策略类受限的 CCE。作为学习较弱版本 CCE 的代价,该算法适用于通用函数逼近下更广泛的问题,例如线性二次博弈以及具有低“边际”Eluder 维数的 MARL 问题。
引用
@article{arxiv.2302.06606,
title = {Breaking the Curse of Multiagency: Provably Efficient Decentralized Multi-Agent RL with Function Approximation},
author = {Yuanhao Wang and Qinghua Liu and Yu Bai and Chi Jin},
journal= {arXiv preprint arXiv:2302.06606},
year = {2023}
}