中文

多智能体模仿学习中的多专家匹配:关于 exploitability 的不可能性与困难性

机器学习 2026-02-25 v1 计算机科学与博弈论 多智能体系统

摘要

多智能体模仿学习 (MA-IL) 旨在从多智能体交互域的专家演示中学习最优策略。尽管已有保证学习得到的策略性能的保证,但对于离线 MA-IL 所学策略与纳什均衡的接近程度的表征仍缺乏。本文通过提供示例表明即便是精确 measure matching 也会失败,并提出一种新的困难性结果来刻画给定固定 measure matching 误差下的纳什间隙 (Nash gap)。随后,我们展示了通过对专家均衡采用战略支配假设可如何克服这些挑战。具体而言,对于占主导策略专家均衡的情况,假设行为克隆误差为 ϵBC\epsilon_{\text{BC}},则可得纳什模仿间隙为 O(nϵBC/(1γ)2)\mathcal{O}\left(n\epsilon_{\text{BC}}/(1-\gamma)^2\right),其中 γ\gamma 为折扣因子。我们通过一种新的最佳响应连续性概念对此结果进行推广,并认为这在标准正则化技术的作用下可能得到隐式鼓励。

关键词

引用

@article{arxiv.2602.21020,
  title  = {Matching Multiple Experts: On the Exploitability of Multi-Agent Imitation Learning},
  author = {Antoine Bergerault and Volkan Cevher and Negar Mehr},
  journal= {arXiv preprint arXiv:2602.21020},
  year   = {2026}
}