胜出动量:异构环境下的协作型联邦强化学习
机器学习
2024-06-03 v1 多智能体系统
最优化与控制
摘要
我们探讨了联邦强化学习(FRL)问题,其中 N 个智能体在不共享轨迹数据的情况下协作学习通用策略。目前,现有的 FRL 研究主要聚焦于运行在相同或“相似”环境的智能体。相反,本问题设置允许环境异构性达到任意大的程度。为获得最大化所有潜在完全不同环境平均性能的 optimal 策略,我们提出了两种算法:FedSVRPG-M 和 FedHAPG-M。与现有结果不同,我们证明了无论环境异构性程度如何,FedSVRPG-M 和 FedHAPG-M 两种算法(均利用动量机制)都能精确收敛到平均性能函数的 stationary 点。此外,通过引入方差缩减技术或 Hessian 近似的优势,两种算法实现了最先进的收敛结果,表现为样本复杂度为 。值得注意的是,我们的算法对于智能体数量具有线性收敛加速,凸显了在寻找通用策略时,智能体之间协作的优势。
引用
@article{arxiv.2405.19499,
title = {Momentum for the Win: Collaborative Federated Reinforcement Learning across Heterogeneous Environments},
author = {Han Wang and Sihong He and Zhili Zhang and Fei Miao and James Anderson},
journal= {arXiv preprint arXiv:2405.19499},
year = {2024}
}