中文

具有层级自适应信用分配的协作多智能体迁移学习

人工智能 2021-06-04 v3

摘要

将迁移学习扩展到协作多智能体强化学习(MARL)近来受到很多关注。与单智能体设置相反,协作 MARL 中不可或缺的合作约束了每个智能体的策略。然而,现有迁移方法仅关注智能体策略而忽略协作知识。我们提出一种新的架构,通过对整体协作适当分解为若干协作模式来实现鲁棒的协作知识迁移。我们使用一种名为层级自适应 QTransformer(LA-QTransformer)的新型混合网络来实现考虑信用分配的智能体协作,通过一种专用于协作知识迁移的新型层级自适应 Transformer(LA-Transformer)为不同智能体实现适当的协作模式。此外,我们使用一种名为带 Transformer 的群体不变智能体(PIT)的新型智能体网络,以在更多样化的场景中实现协作迁移。在 StarCraft II 微操控制中的大量实验表明,LA-QTransformer 与 PIT 结合相比最先进的基线取得了优越性能。

关键词

引用

@article{arxiv.2106.00517,
  title  = {Cooperative Multi-Agent Transfer Learning with Level-Adaptive Credit Assignment},
  author = {Tianze Zhou and Fubiao Zhang and Kun Shao and Kai Li and Wenhan Huang and Jun Luo and Weixun Wang and Yaodong Yang and Hangyu Mao and Bin Wang and Dong Li and Wulong Liu and Jianye Hao},
  journal= {arXiv preprint arXiv:2106.00517},
  year   = {2021}
}

备注

12 pages, 9 figures