中文

一般和低位秩马尔可夫游戏的表示学习

机器学习 2022-11-01 v1 机器学习

摘要

我们研究具有非线性函数逼近的多智能体一般和马尔可夫游戏。我们关注低位秩马尔可夫游戏,其转移矩阵在未知非线性表示之上具有隐藏的低秩结构。目标是设计一种算法,该算法(1)在无需环境或表示先验知识的情况下以样本高效方式找到 ε\varepsilon-均衡策略,且(2)允许深度学习友好的实现。我们利用表示学习并提出基于模型与无模型两种方法来从收集的数据中构建有效表示。对于两种方法,算法均达到 poly(H,d,A,1/ε)(H,d,A,1/\varepsilon) 的样本复杂度,其中 HH 为游戏步长,dd 为特征向量维度,AA 为联合动作空间大小,ε\varepsilon 为最优性差距。当玩家数量较大时,上述样本复杂度在最坏情况下可随玩家数量指数级增长。为应对此挑战,我们考虑具有因子化转移结构的马尔可夫游戏,并给出一种摆脱此类指数级增长的算法。据我们所知,这是首个融合(非线性)函数逼近的、样本高效的多智能体一般和马尔可夫游戏算法。我们以基于神经网络的算法实现伴随理论结果,并与广泛使用的深度 RL 基线(带虚拟博弈的 DQN)进行评估比较。

关键词

引用

@article{arxiv.2210.16976,
  title  = {Representation Learning for General-sum Low-rank Markov Games},
  author = {Chengzhuo Ni and Yuda Song and Xuezhou Zhang and Chi Jin and Mengdi Wang},
  journal= {arXiv preprint arXiv:2210.16976},
  year   = {2022}
}