中文

去中心化乐观超策略镜像下降:马尔可夫博弈中可证明无遗憾学习

机器学习 2022-06-06 v1 机器学习

摘要

我们研究马尔可夫博弈中的去中心化策略学习,其中我们控制单个智能体与非平稳且可能为对抗性的对手进行博弈。我们的目标是开发一种无遗憾的在线学习算法,该算法(i)基于智能体观测到的局部信息采取动作,且(ii)能够找到事后最优策略。对于此类问题,由于对手变化导致的非平稳状态转移带来了重大挑战。鉴于最近的硬度结果 \citep{liu2022learning},我们关注对手的先前策略被揭示给智能体用于决策的设置。基于此种信息结构,我们提出一种新算法,去中心化乐观超策略镜像下降(DORIS),其在一般函数逼近情形下实现 K\sqrt{K} 遗憾,其中 KK 为回合次数。此外,当所有智能体均采用 DORIS 时,我们证明它们的混合策略构成一个近似粗相关均衡。特别地,DORIS 维护一个超策略,即策略空间上的分布。该超策略通过镜像下降更新,其中更新方向由最小二乘策略评估的乐观变体获得。此外,为说明我们所提方法的威力,我们将 DORIS 应用于约束型和向量值 MDP,其可表述为具有虚构对手的零和马尔可夫博弈。

关键词

引用

@article{arxiv.2206.01588,
  title  = {Decentralized Optimistic Hyperpolicy Mirror Descent: Provably No-Regret Learning in Markov Games},
  author = {Wenhao Zhan and Jason D. Lee and Zhuoran Yang},
  journal= {arXiv preprint arXiv:2206.01588},
  year   = {2022}
}