FedFormer:强化学习中使用注意力机制的环境上下文联邦
机器学习
2023-07-19 v3 人工智能
多智能体系统
摘要
多智能体联邦强化学习的一个核心问题是定义如何聚合来自多个智能体的见解。通常的做法是将每个参与智能体的模型权重取平均得到一个通用模型(FedAvg)。我们转而提出 FedFormer,一种新颖的联邦策略,利用 Transformer 注意力来对环境上下文地聚合源自不同学习智能体的模型嵌入。在此过程中,我们根据当前智能体的环境及已学关系注意力加权其他智能体的贡献,从而提供更有效且高效的联邦。我们在 Meta-World 环境上评估了我们的方法,发现相较 FedAvg 和非联邦的 Soft Actor-Critic 单智能体方法,我们的方法取得了显著改进。与 Soft Actor-Critic 相比,我们的结果表明 FedFormer 在遵循联邦学习隐私约束的同时实现了更高的回合回报。最后,我们还展示了在某些任务中随智能体数量增加所有方法有效性的提升。与之形成对比的是,FedAvg 在扩展时未能取得明显改进。
引用
@article{arxiv.2205.13697,
title = {FedFormer: Contextual Federation with Attention in Reinforcement Learning},
author = {Liam Hebert and Lukasz Golab and Pascal Poupart and Robin Cohen},
journal= {arXiv preprint arXiv:2205.13697},
year = {2023}
}
备注
Our source code can be found at https://github.com/liamhebert/FedFormer. Accepted at AAMAS 2023