从数据中以最优速率学习均衡
机器学习
2025-10-13 v1 人工智能
摘要
我们通过刻画非交互式 MAIL 的极限并提出首个具有近最优样本复杂度的交互式算法,弥合了多智能体模仿学习(MAIL)中的开放理论空白。在非交互式设定下,我们证明了一个统计下界,将全策略偏离集中系数识别为基本复杂度度量,并证明行为克隆(BC)是最优速率的。对于交互式设定,我们引入了一个结合无奖励强化学习与交互式 MAIL 的框架,并以算法 MAIL-WARM 实例化。它将此前已知的最佳样本复杂度从 提升至 ,与我们下界所暗示的 依赖关系相匹配。最后,我们提供了数值结果以支持我们的理论,并在网格世界等环境中说明了行为克隆学习失败的情形。
引用
@article{arxiv.2510.09325,
title = {Rate optimal learning of equilibria from data},
author = {Till Freihaut and Luca Viano and Emanuele Nevali and Volkan Cevher and Matthieu Geist and Giorgia Ramponi},
journal= {arXiv preprint arXiv:2510.09325},
year = {2025}
}