中文

S2RL:深度多智能体强化学习是否真的需要感知所有状态?

机器学习 2022-06-23 v1 人工智能

摘要

协作式多智能体强化学习(MARL)已广泛应用于许多实际场景中,其中每个智能体基于自身观测做出决策。大多数主流方法在建模去中心化局部效用函数时将每个局部观测视为整体。然而,它们忽略了局部观测信息可进一步划分为若干实体,且仅有部分实体有助于模型推断。此外,不同实体的重要性可能随时间变化。为提升去中心化策略的性能,注意力机制被用于捕获局部信息特征。但现有注意力模型依赖稠密全连接图,无法更好地感知重要状态。为此,我们提出一种基于稀疏状态的多智能体强化学习(S2RL)框架,利用稀疏注意力机制丢弃局部观测中的无关信息。局部效用函数分别通过自注意力与稀疏注意力机制估计,随后在中央评论家中组合为标准联合值函数与辅助联合值函数。我们将 S2RL 框架设计为即插即用模块,使其具有足够通用性以应用于多种方法。在 StarCraft II 上的大量实验表明,S2RL 能显著提升许多最先进方法的性能。

关键词

引用

@article{arxiv.2206.11054,
  title  = {S2RL: Do We Really Need to Perceive All States in Deep Multi-Agent Reinforcement Learning?},
  author = {Shuang Luo and Yinchuan Li and Jiahui Li and Kun Kuang and Furui Liu and Yunfeng Shao and Chao Wu},
  journal= {arXiv preprint arXiv:2206.11054},
  year   = {2022}
}