中文

从数据中学习均衡:可证明高效的多智能体模仿学习

机器学习 2025-10-10 v2

摘要

本文首次给出了从专家数据中学习马尔可夫博弈中纳什均衡的专家样本复杂度特征。我们证明,在非交互式模仿学习设定下,一种名为单策略偏差集中系数的新量是不可避免的,并且我们给出了行为克隆(BC)带有该系数的上界。BC 在集中系数较高的博弈中表现出显著遗憾,这促使我们利用专家查询来开发和引入两种新颖的求解算法:MAIL-BRO 和 MURMAIL。前者采用最佳响应预言机,以 O(ε4)\mathcal{O}(\varepsilon^{-4}) 的专家和预言机查询学习一个 ε\varepsilon-纳什均衡。后者完全绕过最佳响应预言机,代价是更差的专家查询复杂度,阶为 O(ε8)\mathcal{O}(\varepsilon^{-8})。最后,我们提供了数值证据,确认了我们的理论发现。

关键词

引用

@article{arxiv.2505.17610,
  title  = {Learning Equilibria from Data: Provably Efficient Multi-Agent Imitation Learning},
  author = {Till Freihaut and Luca Viano and Volkan Cevher and Matthieu Geist and Giorgia Ramponi},
  journal= {arXiv preprint arXiv:2505.17610},
  year   = {2025}
}