重访 QMIX:基于梯度熵正则化的判别式信用分配
人工智能
2022-02-17 v2
摘要
在合作多智能体系统中,智能体联合采取行动并接收团队奖励而非个体奖励。在缺乏个体奖励信号的情况下,通常引入信用分配机制以区分不同智能体的贡献,从而实现有效合作。近年来,值分解范式被广泛用于实现信用分配,QMIX 已成为最先进(SOTA)的解决方案。本文从两方面重访 QMIX。首先,我们提出一种信用分配度量的新视角,并通过实证表明 QMIX 在智能体信用分配上的判别力有限。其次,我们提出一种结合 QMIX 的梯度熵正则化以实现判别式信用分配,从而提升整体性能。实验表明,我们的方法能相对提高学习效率并取得更好性能。
引用
@article{arxiv.2202.04427,
title = {Revisiting QMIX: Discriminative Credit Assignment by Gradient Entropy Regularization},
author = {Jian Zhao and Yue Zhang and Xunhan Hu and Weixun Wang and Wengang Zhou and Jianye Hao and Jiangcheng Zhu and Houqiang Li},
journal= {arXiv preprint arXiv:2202.04427},
year = {2022}
}