中文

用于平均场博弈中高效独立学习的策略镜像上升法

最优化与控制 2023-06-12 v2 计算机科学与博弈论 机器学习 机器学习

摘要

平均场博弈已被用作获取对称且匿名NN人博弈近似纳什均衡的理论工具。然而,现有理论结果假设了“总体生成模型”的变体,限制了适用性,该模型允许学习算法对总体分布进行任意修改。此外,学习算法通常在具有总体的抽象模拟器上工作,而非在NN人博弈上。相反,我们证明了运行策略镜像上升的NN个智能体,在无需总体生成模型的情况下,从单条样本轨迹以O~(ε2)\widetilde{\mathcal{O}}(\varepsilon^{-2})样本收敛到正则化博弈的纳什均衡,误差至多为标准的平均场引起的O(1N)\mathcal{O}(\frac{1}{\sqrt{N}})。与文献采用不同路径,我们不使用最佳响应映射,而是首先证明策略镜像上升映射可用于构造以纳什均衡为不动点的压缩算子。我们分析了NN智能体博弈的单路径TD学习,仅使用来自NN智能体模拟器的样本路径而无总体生成模型,证明了样本复杂度保证。此外,我们展示了我们的方法允许NN个智能体进行具有有限样本保证的独立学习。

关键词

引用

@article{arxiv.2212.14449,
  title  = {Policy Mirror Ascent for Efficient and Independent Learning in Mean Field Games},
  author = {Batuhan Yardim and Semih Cayci and Matthieu Geist and Niao He},
  journal= {arXiv preprint arXiv:2212.14449},
  year   = {2023}
}

备注

Accepted for publication at ICML 2023