用于稳定平均场博弈的策略更新正则化
人工智能
2023-04-14 v2
摘要
本研究探讨非合作多智能体强化学习(MARL),其中多个智能体在同一环境中交互,目标是最大化个体回报。当智能体数量增加时,由于大量智能体引入的非平稳性,挑战随之产生。为应对此问题,平均场博弈(MFG)依赖对称性与同质性假设来近似具有极大量人口的博弈。近来,深度强化学习已被用于将上述博弈扩展到具有更多状态的游戏。现有方法依赖平滑技术,例如对 q 值或平均场分布上的更新进行平均。本工作提出了一种基于平均场策略上近端更新的不同方法来稳定学习。我们将所提算法命名为平均场近端策略优化(MF-PPO),并在 OpenSpiel 框架中实证展示了方法的有效性。
引用
@article{arxiv.2304.01547,
title = {Regularization of the policy updates for stabilizing Mean Field Games},
author = {Talal Algumaei and Ruben Solozabal and Reda Alami and Hakim Hacid and Merouane Debbah and Martin Takac},
journal= {arXiv preprint arXiv:2304.01547},
year = {2023}
}