中文

DIML:从多智能体学习轨迹中学习可微逆机制

人工智能 2026-01-27 v1 计算机科学与博弈论

摘要

我们研究逆机制学习:从观察到的自爱学习智能体的战略交互痕迹中恢复未知的激励生成机制。不同于逆博弈论和多智能体逆强化学习,后者通常推断结构化机制内部的效用/奖励参数;我们目标包括非结构化机制——一种可能是神经网络的从联合动作到各智能体收益的映射。不同于可微机制设计,后者正向优化机制;我们在观察性语境中从行为推断机制。我们提出 DIML,一个基于似然函数的框架,通过对多智能体学习动力学进行微分,并使用候选机制生成所需的反事实收益来预测观察到的动作。我们在条件 logit 响应模型下建立收益差的可识别性,并在标准正则性条件下证明最大似然估计的统计一致性。我们通过模拟的多智能体学习交互评估了 DIML,涵盖非结构化神经网络机制、拥堵 Tolling、公共财物补贴以及大规模匿名游戏。DIML 可靠地恢复可识别的激励差异,支持反事实预测,其中在小型环境中性能与表格枚举 oracle 相当,在大规模(百人)环境中收敛性显著提升。用于复现实验的代码已开源。

关键词

引用

@article{arxiv.2601.17678,
  title  = {DIML: Differentiable Inverse Mechanism Learning from Behaviors of Multi-Agent Learning Trajectories},
  author = {Zhiyu An and Wan Du},
  journal= {arXiv preprint arXiv:2601.17678},
  year   = {2026}
}