中文

具有结构化转移的零和马尔可夫博弈中可证明高效的虚拟博弈策略优化

机器学习 2022-07-27 v1 人工智能 计算机科学与博弈论

摘要

尽管近期强化学习界对固定环境中的单智能体策略优化给予了大量关注,但对于多智能体在潜在竞争环境中博弈的理论认知仍十分有限。我们提出并分析了面向具有结构化但未知转移的零和马尔可夫博弈的新型虚拟博弈策略优化算法,向前推进了一步。我们考虑两类转移结构:因子化独立转移与单控制器转移。在这两种情形下,我们证明了在双智能体竞争博弈场景中经过 KK 轮回合后紧致的 O~(K)\widetilde{\mathcal{O}}(\sqrt{K}) 后悔界。每个智能体的后悔是相对于一个潜在的对抗性对手来度量的,该对手可在观测到完整策略序列后于事后选取单一最优策略。我们的算法结合了上置信界(UCB)型乐观估计与非平稳环境下同步策略优化范畴内的虚拟博弈。当双方均采用所提算法时,其总体最优性差距为 O~(K)\widetilde{\mathcal{O}}(\sqrt{K})

关键词

引用

@article{arxiv.2207.12463,
  title  = {Provably Efficient Fictitious Play Policy Optimization for Zero-Sum Markov Games with Structured Transitions},
  author = {Shuang Qiu and Xiaohan Wei and Jieping Ye and Zhaoran Wang and Zhuoran Yang},
  journal= {arXiv preprint arXiv:2207.12463},
  year   = {2022}
}

备注

ICML 2021