中文

生成模型下马尔可夫博弈中极小极大最优的多智能体强化学习

机器学习 2022-10-13 v2 计算机科学与博弈论 信息论 系统与控制 系统与控制 math.IT 机器学习

摘要

本文研究马尔可夫博弈中的多智能体强化学习,目标是样本最优地学习纳什均衡或粗相关均衡(CCE)。所有先前的结果都至少受到两个障碍之一的影响:多智能体诅咒和长视界壁垒,无论使用何种采样协议。我们朝着解决这一问题迈出一步,假设可访问一种灵活的采样机制:生成模型。聚焦于非平稳有限视界马尔可夫博弈,我们开发了一种称为\myalg的快速学习算法以及一种自适应采样方案,它们利用了在线对抗学习中的乐观原则(特别是Follow-the-Regularized-Leader(FTRL)方法)。我们的算法在一般和马尔可夫博弈中使用O~(H4Si=1mAiε2)\widetilde{O}\bigg( \frac{H^4 S \sum_{i=1}^m A_i}{\varepsilon^2} \bigg)个样本学习一个ε\varepsilon-近似CCE,其中mm为玩家数量,SS表示状态数,HH为视界,AiA_i表示第ii个玩家的动作数。当玩家数量固定时,这是极小极大最优的(至多相差对数因子)。当应用于两人零和马尔可夫博弈时,我们的算法可证明地以最少样本找到一个ε\varepsilon-近似纳什均衡。在此过程中,我们推导了FTRL的一个精细化后悔界,明确了方差型量的作用,这本身可能具有独立意义。

关键词

引用

@article{arxiv.2208.10458,
  title  = {Minimax-Optimal Multi-Agent RL in Markov Games With a Generative Model},
  author = {Gen Li and Yuejie Chi and Yuting Wei and Yuxin Chen},
  journal= {arXiv preprint arXiv:2208.10458},
  year   = {2022}
}

备注

accepted in part to NeurIPS 2022