中文

扩展式博弈中相关均衡的样本高效学习

机器学习 2022-05-17 v1 计算机科学与博弈论 机器学习

摘要

不完美信息扩展式博弈(IIEFGs)是涉及不完美信息与序贯行动的实时博弈的普遍模型。扩展式相关均衡(EFCE)已被提出作为多人一般和IIEFGs的自然解概念。然而,现有寻找EFCE的算法需要来自博弈的完全反馈,如何在更具挑战性的_bandit反馈_设定下高效学习EFCE仍属开放问题——该设定中只能通过重复博弈的观测来学习博弈。本文提出了首个从bandit反馈学习EFCE的样本高效算法。我们首先提出 KK-EFCE——一种更广义的定义,允许玩家观测并偏离推荐动作 KK 次。 KK-EFCE在 K=1K=1 时包含EFCE作为特例,且随 KK 增大是越来越严格均衡概念。随后我们设计了一种解耦无遗憾算法,在完全反馈设定下于 O~(maxiXiAiK/ε2)\widetilde{\mathcal{O}}(\max_{i}X_iA_i^{K}/\varepsilon^2) 次迭代内找到 ε\varepsilon-近似 KK-EFCE,其中 XiX_iAiA_i 为第 ii 个玩家的信息集数与动作数。我们的算法通过最小化每个信息集上考虑所有可能推荐历史的宽范围遗憾来工作。最后,我们设计了算法的基于样本的变体,在bandit反馈设定下于 O~(maxiXiAiK+1/ε2)\widetilde{\mathcal{O}}(\max_{i}X_iA_i^{K+1}/\varepsilon^2) 次博弈回合内学习到 ε\varepsilon-近似 KK-EFCE。当取 K=1K=1 时,这给出了首个从bandit反馈学习EFCE的样本高效算法。

关键词

引用

@article{arxiv.2205.07223,
  title  = {Sample-Efficient Learning of Correlated Equilibria in Extensive-Form Games},
  author = {Ziang Song and Song Mei and Yu Bai},
  journal= {arXiv preprint arXiv:2205.07223},
  year   = {2022}
}