均场游戏的可扩展离线强化学习
机器学习
2024-10-24 v1 多智能体系统
摘要
均场游戏的强化学习算法提供了一种 scalable 框架,用于优化大规模相互作用代理的策略。现有方法通常依赖于在线交互或系统动力学的访问,在现实场景中难以实现或建模此类交互时受到限制。本文提出 Offline Munchausen Mirror Descent(Off-MMD),这是一种新的均场 RL 算法,可仅使用离线数据来逼近均场游戏中的均衡策略。通过利用迭代镜像梯度和重要性抽样技术,Off-MMD 可从静态数据集中估计均场分布,而无需依赖仿真或环境动力学。此外,我们采纳离线强化学习中的技术来解决 Q 值高估等常见问题,确保即使在数据覆盖范围有限的情况下也能实现稳健的策略学习。我们的算法可扩展到复杂环境,并在类似人群探索或导航的基准任务上显示出色,凸显其针对在线实验不可行的现实多智能体系统的适用性。我们经验性地展示了 Off-MMD 对低质量数据集的鲁棒性,并开展实验以探讨其对超参数选择的敏感性。
引用
@article{arxiv.2410.17898,
title = {Scalable Offline Reinforcement Learning for Mean Field Games},
author = {Axel Brunnbauer and Julian Lemmel and Zahra Babaiee and Sophie Neubauer and Radu Grosu},
journal= {arXiv preprint arXiv:2410.17898},
year = {2024}
}
备注
Submitted to AAMAS