中文

Stackelberg博弈中相关策略的模仿学习

人工智能 2025-07-01 v3

摘要

Stackelberg博弈广泛应用于经济学和安全等领域,涉及领导者策略驱动跟随者响应的非对称交互。准确建模这些动态使领域专家能够在交互场景(如羽毛球等回合制运动)中优化策略。在多智能体系统中,智能体行为是相互依赖的,而传统的多智能体模仿学习(MAIL)方法往往无法捕捉这些复杂的交互。考虑对手策略的相关策略对于准确建模此类动态至关重要。然而,即使是专为学习相关策略设计的方法(如CoDAIL),在Stackelberg博弈中也表现不佳,因为其决策具有非对称性,领导者和跟随者无法同时考虑彼此的行动,往往导致非相关策略。此外,匹配占用测度或使用GAIL或逆向强化学习等对抗技术的现有MAIL方法面临可扩展性挑战,特别是在高维环境中,且训练不稳定。为了应对这些挑战,我们提出了一种专为Stackelberg博弈设计的相关策略占用测度,并引入了潜在Stackelberg微分网络(LSDN)来匹配它。LSDN将双智能体交互建模为共享的潜在状态轨迹,并使用多输出几何布朗运动(MO-GBM)来有效捕捉联合策略。通过利用MO-GBM,LSDN在潜在空间中将环境影响与智能体驱动的状态转移解耦,从而实现相互依赖策略的同步学习。这种设计消除了对抗训练的需要并简化了学习过程。在迭代矩阵博弈和多智能体粒子环境上的大量实验表明,LSDN比现有的MAIL方法能更好地重现复杂的交互动态。

关键词

引用

@article{arxiv.2503.08883,
  title  = {Imitation Learning of Correlated Policies in Stackelberg Games},
  author = {Kuang-Da Wang and Ping-Chun Hsieh and Wen-Chih Peng},
  journal= {arXiv preprint arXiv:2503.08883},
  year   = {2025}
}

备注

We apologize for the premature submission. Upon further review, we found that the Stackelberg game formulation and turn-based setting were not clearly defined, and the discussion of alternative solutions was incomplete. As the required revisions will be time-consuming, we believe it is more responsible to withdraw the paper to prevent any potential misunderstanding by readers