具有独立线性函数近似的马尔可夫博弈的精细样本复杂度
机器学习
2024-06-12 v2 计算机科学与博弈论
机器学习
摘要
马尔可夫博弈(MG)是多智能体强化学习(MARL)的一个重要模型。长期以来,人们一直认为“多智能体诅咒”(即算法性能随智能体数量呈指数级下降)是不可避免的,直到最近的几项工作(Daskalakis 等人,2023;Cui 等人,2023;Wang 等人,2023)出现。虽然这些工作解决了多智能体诅咒,但当状态空间过大并采用(线性)函数近似时,它们要么收敛速度较慢,为 ,要么对动作数量 产生了多项式依赖——而在单智能体情况下,即使损失函数可以随时间任意变化,这种依赖也是可以避免的。本文首先通过设计*数据依赖*(即随机)的次优性间隙悲观估计,改进了 Wang 等人(2023)的 AVLPR 框架,从而允许更广泛的插件算法选择。当专门用于具有独立线性函数近似的 MG 时,我们提出了新颖的*动作依赖奖励*来覆盖偶尔出现的极端估计误差。借助单智能体 RL 文献中最先进的技术,我们给出了第一个解决多智能体诅咒、达到最优 收敛速度,并同时避免 依赖的算法。
引用
@article{arxiv.2402.07082,
title = {Refined Sample Complexity for Markov Games with Independent Linear Function Approximation},
author = {Yan Dai and Qiwen Cui and Simon S. Du},
journal= {arXiv preprint arXiv:2402.07082},
year = {2024}
}
备注
Accepted for presentation at the Conference on Learning Theory (COLT) 2024