中文

从数据中以最优速率学习均衡

机器学习 2025-10-13 v1 人工智能

摘要

我们通过刻画非交互式 MAIL 的极限并提出首个具有近最优样本复杂度的交互式算法,弥合了多智能体模仿学习(MAIL)中的开放理论空白。在非交互式设定下,我们证明了一个统计下界,将全策略偏离集中系数识别为基本复杂度度量,并证明行为克隆(BC)是最优速率的。对于交互式设定,我们引入了一个结合无奖励强化学习与交互式 MAIL 的框架,并以算法 MAIL-WARM 实例化。它将此前已知的最佳样本复杂度从 O(ε8)\mathcal{O}(\varepsilon^{-8}) 提升至 O(ε2)\mathcal{O}(\varepsilon^{-2}),与我们下界所暗示的 ε\varepsilon 依赖关系相匹配。最后,我们提供了数值结果以支持我们的理论,并在网格世界等环境中说明了行为克隆学习失败的情形。

关键词

引用

@article{arxiv.2510.09325,
  title  = {Rate optimal learning of equilibria from data},
  author = {Till Freihaut and Luca Viano and Emanuele Nevali and Volkan Cevher and Matthieu Geist and Giorgia Ramponi},
  journal= {arXiv preprint arXiv:2510.09325},
  year   = {2025}
}