生成模型下马尔可夫博弈中极小极大最优的多智能体强化学习
机器学习
2022-10-13 v2 计算机科学与博弈论
信息论
系统与控制
系统与控制
math.IT
机器学习
摘要
本文研究马尔可夫博弈中的多智能体强化学习,目标是样本最优地学习纳什均衡或粗相关均衡(CCE)。所有先前的结果都至少受到两个障碍之一的影响:多智能体诅咒和长视界壁垒,无论使用何种采样协议。我们朝着解决这一问题迈出一步,假设可访问一种灵活的采样机制:生成模型。聚焦于非平稳有限视界马尔可夫博弈,我们开发了一种称为\myalg的快速学习算法以及一种自适应采样方案,它们利用了在线对抗学习中的乐观原则(特别是Follow-the-Regularized-Leader(FTRL)方法)。我们的算法在一般和马尔可夫博弈中使用个样本学习一个-近似CCE,其中为玩家数量,表示状态数,为视界,表示第个玩家的动作数。当玩家数量固定时,这是极小极大最优的(至多相差对数因子)。当应用于两人零和马尔可夫博弈时,我们的算法可证明地以最少样本找到一个-近似纳什均衡。在此过程中,我们推导了FTRL的一个精细化后悔界,明确了方差型量的作用,这本身可能具有独立意义。
引用
@article{arxiv.2208.10458,
title = {Minimax-Optimal Multi-Agent RL in Markov Games With a Generative Model},
author = {Gen Li and Yuejie Chi and Yuting Wei and Yuxin Chen},
journal= {arXiv preprint arXiv:2208.10458},
year = {2022}
}
备注
accepted in part to NeurIPS 2022