线性马尔可夫游戏中的多智能体模仿学习及其扩展
机器学习
2026-02-27 v1
摘要
本文首次对线性马尔可夫游戏中的多智能体模仿学习(MAIL)进行理论分析,其中转移动力学和每个智能体的奖励函数均线性依赖于给定特征。我们表明,凭借这一结构,能够将基于状态-动作层面的“全策略偏差集中性系数”(Freihaut 等,arXiv:2510.09325)替换为定义在特征层面的集中性系数,这在特征信息丰富时可远小于状态-动作版本。进一步,为规避任何集中性系数的需求,我们转向交互式设置。我们提供首个针对线性马尔可夫游戏的高效计算交互式 MAIL 算法,证明其样本复杂度仅取决于特征图的维数 d。基于这些理论发现,我们提出一种深度 MAIL 交互式算法,在井字棋和连连看等游戏中显著优于行为克隆。
引用
@article{arxiv.2602.22810,
title = {Multi-agent imitation learning with function approximation: Linear Markov games and beyond},
author = {Luca Viano and Till Freihaut and Emanuele Nevali and Volkan Cevher and Matthieu Geist and Giorgia Ramponi},
journal= {arXiv preprint arXiv:2602.22810},
year = {2026}
}