关于平均场博弈中的模仿学习
机器学习
2023-06-27 v1 计算机科学与博弈论
摘要
我们探讨了平均场博弈(MFGs)背景下的模仿学习(IL)问题,其目标是模仿遵循某一纳什均衡策略、依据某个未知收益函数行动的智能体群体的行为。与单智能体 IL 相比,MFGs 中的 IL 带来了新的挑战,特别是当奖励函数与转移核均依赖于群体分布时。本文脱离现有 MFGs 的 IL 文献,引入了一种称为纳什模仿差距(Nash imitation gap)的新解概念。接着我们表明,当仅奖励依赖于群体分布时,MFGs 中的 IL 可归约为具类似保证的单智能体 IL。然而,当动力学依赖于群体时,我们给出了一个新的上界,表明此设定下 IL 更为困难。为解决该问题,我们提出了一种新的对抗式表述,其中强化学习问题被平均场控制(MFC)问题所替代,这表明 MFGs 中 IL 的进展可能必须建立在 MFC 之上。
引用
@article{arxiv.2306.14799,
title = {On Imitation in Mean-field Games},
author = {Giorgia Ramponi and Pavel Kolev and Olivier Pietquin and Niao He and Mathieu Laurière and Matthieu Geist},
journal= {arXiv preprint arXiv:2306.14799},
year = {2023}
}