中文

打破多智能体状态空间的维度诅咒:一种统一的智能体置换框架

机器学习 2022-10-20 v2 人工智能 多智能体系统

摘要

多智能体强化学习(MARL)中的状态空间随智能体数量呈指数增长。此种维度诅咒导致可扩展性差与样本效率低,数十年来制约着 MARL。为打破该诅咒,我们提出一种统一的智能体置换框架,利用置换不变性(PI)与置换等变性(PE)归纳偏置来缩减多智能体状态空间。我们的洞见是:在因子化多智能体状态空间中对实体顺序进行置换并不改变信息。具体而言,我们提出两种新颖实现:动态置换网络(DPN)与超策略网络(HPN)。其核心思想是构建独立的实体级 PI 输入与 PE 输出网络模块,以端到端方式连接实体因子化状态空间与动作空间。DPN 通过两个独立的模块选择网络实现此类连接,其始终将相同输入模块分配给相同输入实体(保证 PI),并将相同输出模块分配给相同实体相关输出(保证 PE)。为增强表示能力,HPN 以超网络替换 DPN 的模块选择网络,直接生成相应模块权重。在 SMAC、Google Research Football 与 MPE 上的大量实验验证了所提方法显著提升了现有 MARL 算法的性能与学习效率。尤为突出的是,在 SMAC 中,我们几乎在所有困难与超困难场景均取得 100% 胜率(此前从未实现)。

关键词

引用

@article{arxiv.2203.05285,
  title  = {Breaking the Curse of Dimensionality in Multiagent State Space: A Unified Agent Permutation Framework},
  author = {Xiaotian Hao and Hangyu Mao and Weixun Wang and Yaodong Yang and Dong Li and Yan Zheng and Zhen Wang and Jianye Hao},
  journal= {arXiv preprint arXiv:2203.05285},
  year   = {2022}
}