面向多智能体价值分解的对比身份感知学习
机器学习
2023-03-15 v2 人工智能
多智能体系统
摘要
价值分解(VD)旨在仅有全局奖励的情况下推断智能体对分散策略的贡献,近来已成为解决合作式多智能体强化学习(MARL)问题的有力信用分配范式。VD 的主要挑战之一在于促进智能体间的多样化行为,而现有方法直接以各类策略鼓励所学智能体网络的多样性。然而,我们认为这些针对智能体网络的专门设计仍受限于难以区分的 VD 网络,导致同质化智能体行为,进而削弱合作能力。本文提出一种新颖的对比身份感知学习(CIA)方法,显式提升 VD 网络的信用级可区分性,以打破多智能体多样性的瓶颈。具体而言,我们的方法利用对比学习最大化不同智能体的时序信用与身份表示间的互信息,鼓励信用分配的充分表达性并进一步催生个体性。所提 CIA 模块算法实现简单而有效,可便捷嵌入各类 VD 架构。在 SMAC 基准及不同 VD 主干上的实验表明,该方法取得优于最先进同类方法的结果。我们的代码见 https://github.com/liushunyu/CIA。
引用
@article{arxiv.2211.12712,
title = {Contrastive Identity-Aware Learning for Multi-Agent Value Decomposition},
author = {Shunyu Liu and Yihe Zhou and Jie Song and Tongya Zheng and Kaixuan Chen and Tongtian Zhu and Zunlei Feng and Mingli Song},
journal= {arXiv preprint arXiv:2211.12712},
year = {2023}
}