基于深度强化学习的均值场博弈人口感知在线镜像下降法
计算机科学与博弈论
2024-03-07 v1 机器学习
多智能体系统
系统与控制
系统与控制
摘要
均值场博弈 (MFGs) 具备处理大规模多智能体系统的能力,但在 MFGs 中学习纳什均衡仍是一项挑战性任务。本文提出了一种深度强化学习 (DRL) 算法,受 Munchausen RL 和在线镜像下降法启发,无需对历史进行平均或采样即可实现依赖于人口的纳什均衡。通过设计额外的内循环回放缓冲区,智能体能够有效学习从任意分布达成纳什均衡,从而缓解灾难性遗忘问题。所得策略可应用于各种初始分布。在四个典型算例上的数值实验表明,我们的算法比现有最先进 (SOTA) 算法具有更好的收敛特性,特别是相较于针对依赖于人口策略的虚拟博弈 (Fictitious Play) 的 DRL 版本。
引用
@article{arxiv.2403.03552,
title = {Population-aware Online Mirror Descent for Mean-Field Games by Deep Reinforcement Learning},
author = {Zida Wu and Mathieu Lauriere and Samuel Jia Cong Chua and Matthieu Geist and Olivier Pietquin and Ankur Mehta},
journal= {arXiv preprint arXiv:2403.03552},
year = {2024}
}