面向平均场博弈的个体级逆强化学习
机器学习
2022-02-15 v1 计算机科学与博弈论
多智能体系统
摘要
近期的平均场博弈(MFG)形式化使得逆强化学习(IRL)方法能够应用于大规模多智能体系统,目的是推断能够解释大规模群体演示行为的奖励信号。现有的 MFG 逆强化学习方法建立在将 MFG 化简为定义于群体集体行为和平均奖励上的马尔可夫决策过程(MDP)之上。然而,本文揭示从 MFG 到 MDP 的化简仅对完全合作设置成立。这一局限使得现有 IRL 方法在非合作环境的 MFG 上失效。为了度量大规模群体中更一般的行为,我们研究利用个体行为来推断 MFG 的真实奖励函数。我们提出 Mean Field IRL(MFIRL),这是首个专为 MFG 设计、可处理合作与非合作环境的 IRL 框架。基于这一理论可靠的框架,我们开发了在动态未知 MFG 中有效的实用算法。我们在包含众多智能体的合作以及合作-竞争混合场景上评估了 MFIRL。结果表明,MFIRL 在奖励恢复、样本效率以及面对动态变化时的鲁棒性方面表现优异。
引用
@article{arxiv.2202.06401,
title = {Individual-Level Inverse Reinforcement Learning for Mean Field Games},
author = {Yang Chen and Libo Zhang and Jiamou Liu and Shuyue Hu},
journal= {arXiv preprint arXiv:2202.06401},
year = {2022}
}
备注
accepted to AAMAS 2022