面向多智能体强化学习的交互模式解耦
机器学习
2024-05-24 v4 人工智能
多智能体系统
摘要
深度协作多智能体强化学习已在大量复杂控制任务中展现出显著成功。然而,多智能体学习的近期进展主要聚焦于值分解,而实体交互仍相互纠缠,这容易导致对实体间噪声交互的过拟合。在本工作中,我们提出一种新颖的交互模式解耦(OPT)方法,将实体交互解耦为若干交互原型,每个原型代表实体子组内一种潜在的交互模式。OPT 有助于过滤不相关实体间的噪声交互,从而显著提升泛化能力与可解释性。具体而言,OPT 引入稀疏分歧机制以鼓励所发现交互原型间的稀疏性与多样性。随后,模型通过具有可学习权重的聚合器将这些原型选择性地重构为紧凑的交互模式。为缓解由部分可观测性引发的训练不稳定问题,我们提出最大化聚合权重与各智能体历史行为之间的互信息。在单任务、多任务与零样本基准上的实验表明,所提方法取得的结果优于最先进的同类方法。我们的代码见 https://github.com/liushunyu/OPT。
引用
@article{arxiv.2207.03902,
title = {Interaction Pattern Disentangling for Multi-Agent Reinforcement Learning},
author = {Shunyu Liu and Jie Song and Yihe Zhou and Na Yu and Kaixuan Chen and Zunlei Feng and Mingli Song},
journal= {arXiv preprint arXiv:2207.03902},
year = {2024}
}
备注
Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)