中文

面向平均场博弈的个体级逆强化学习

机器学习 2022-02-15 v1 计算机科学与博弈论 多智能体系统

摘要

近期的平均场博弈(MFG)形式化使得逆强化学习(IRL)方法能够应用于大规模多智能体系统,目的是推断能够解释大规模群体演示行为的奖励信号。现有的 MFG 逆强化学习方法建立在将 MFG 化简为定义于群体集体行为和平均奖励上的马尔可夫决策过程(MDP)之上。然而,本文揭示从 MFG 到 MDP 的化简仅对完全合作设置成立。这一局限使得现有 IRL 方法在非合作环境的 MFG 上失效。为了度量大规模群体中更一般的行为,我们研究利用个体行为来推断 MFG 的真实奖励函数。我们提出 Mean Field IRL(MFIRL),这是首个专为 MFG 设计、可处理合作与非合作环境的 IRL 框架。基于这一理论可靠的框架,我们开发了在动态未知 MFG 中有效的实用算法。我们在包含众多智能体的合作以及合作-竞争混合场景上评估了 MFIRL。结果表明,MFIRL 在奖励恢复、样本效率以及面对动态变化时的鲁棒性方面表现优异。

关键词

引用

@article{arxiv.2202.06401,
  title  = {Individual-Level Inverse Reinforcement Learning for Mean Field Games},
  author = {Yang Chen and Libo Zhang and Jiamou Liu and Shuyue Hu},
  journal= {arXiv preprint arXiv:2202.06401},
  year   = {2022}
}

备注

accepted to AAMAS 2022