TransfQMix:利用Transformer挖掘多智能体强化学习问题的图结构
机器学习
2023-01-16 v1 人工智能
多智能体系统
摘要
协调是多智能体强化学习(MARL)中最困难的方面之一。一个原因是智能体通常独立地选择其动作。为了看到从独立策略组合中涌现出的协调策略,近期研究集中于使用一个集中式函数(CF)来学习每个智能体对团队奖励的贡献。然而,环境呈现给智能体和CF的结构通常被忽视。我们观察到,用于描述协调问题的特征可以表示为一个潜在图结构的顶点特征。在此,我们提出TransfQMix,一种利用transformer来挖掘这种潜在结构并学习更好协调策略的新方法。我们的transformer智能体对可观察实体的状态进行图推理。我们的transformer Q-mixer从一个包含智能体内部和外部状态的更大图中学习单调混合函数。TransfQMix被设计为完全可迁移的,这意味着相同的参数可用于控制和训练更大或更小的智能体团队。这使得在MARL中部署有前景的方法以节省训练时间并推导通用策略成为可能,例如迁移学习、零样本迁移和课程学习。我们报告了TransfQMix在Spread和星际争霸II(StarCraft II)环境中的性能。在这两种设置下,它都优于最先进的Q-Learning模型,并展示了在解决其他方法无法解决的问题上的有效性。
引用
@article{arxiv.2301.05334,
title = {TransfQMix: Transformers for Leveraging the Graph Structure of Multi-Agent Reinforcement Learning Problems},
author = {Matteo Gallici and Mario Martin and Ivan Masmitja},
journal= {arXiv preprint arXiv:2301.05334},
year = {2023}
}
备注
Accepted at AAMAS 2023. Code at https://github.com/mttga/pymarl_transformers