PPS-QMIX:周期性参数共享以加速多智能体强化学习的收敛
人工智能
2024-03-06 v1
摘要
多智能体强化学习 (MARL) 的训练是一个耗时的过程,这是由每个智能体的分布偏移引起的。其中一个缺点是,MARL 中每个智能体的策略是独立的,但实际上它们处于协作关系中。因此,多智能体强化学习中的一个垂直问题是如何高效地加速训练过程。为解决这一问题,当前研究利用跨多个智能体的集中式函数 (CF) 来学习团队奖励对每个智能体的贡献。然而,基于 CF 的方法在价值网络估计中引入了来自其他智能体的联合误差。受联邦学习启发,我们提出了三种简单新颖的方法,称为平均周期性参数共享 (A-PPS)、奖励可扩展性周期性参数共享 (RS-PPS) 和部分个性化周期性参数共享 (PP-PPS) 机制,以加速 MARL 的训练。智能体在训练过程中周期性共享 Q 值网络。具有相同身份的智体将收集的奖励作为可扩展性进行调整,并在周期内更新部分神经网络以共享不同的参数。我们将这些方法应用于经典的 MARL 方法 QMIX,并在星际争霸多智能体挑战 (SMAC) 环境的各种任务上进行评估。数值实验结果显示性能显著提升,平均改进幅度为 10%-30%,并能够赢得 QMIX 无法获胜的任务。我们的代码可从 https://github.com/ColaZhang22/PPS-QMIX 下载。
引用
@article{arxiv.2403.02635,
title = {PPS-QMIX: Periodically Parameter Sharing for Accelerating Convergence of Multi-Agent Reinforcement Learning},
author = {Ke Zhang and DanDan Zhu and Qiuhan Xu and Hao Zhou and Ce Zheng},
journal= {arXiv preprint arXiv:2403.02635},
year = {2024}
}
备注
10 pages, 5 figures