中文

UPDeT:基于 Transformer 策略解耦的通用多智能体强化学习

机器学习 2021-02-09 v3 人工智能

摘要

多智能体强化学习的近期进展很大程度上受限于为每个新任务从零训练一个模型。该局限源于与固定输入输出维度相关的受限模型架构。这阻碍了学习到的智能体在具有不同难度级别的任务(如 3 对 3 或 5 对 6 多智能体博弈)间的经验积累与迁移。本文首次尝试探索通用多智能体强化学习流程,设计单一架构以适配具有不同观测与动作配置需求的任务。与先前基于 RNN 的模型不同,我们利用基于 transformer 的模型,通过利用自注意力机制优势测得的重要性权重,将策略分布从交织的输入观测中解耦,从而生成灵活策略。相较标准 transformer 模块,所提名为通用策略解耦 Transformer(UPDeT)的模型进一步放宽了动作限制,并使多智能体任务的决策过程更具可解释性。UPDeT 具有足够通用性,可插入任意多智能体强化学习流程,赋予其强大泛化能力,能够同时处理多任务。在大规模 SMAC 多智能体对抗博弈上的大量实验表明,所提基于 UPDeT 的多智能体强化学习相较 SOTA 方法取得显著结果,展现出在性能与训练速度(快 10 倍)方面的优越迁移能力。

关键词

引用

@article{arxiv.2101.08001,
  title  = {UPDeT: Universal Multi-agent Reinforcement Learning via Policy Decoupling with Transformers},
  author = {Siyi Hu and Fengda Zhu and Xiaojun Chang and Xiaodan Liang},
  journal= {arXiv preprint arXiv:2101.08001},
  year   = {2021}
}

备注

15 pages, 8 figures