同策略异构联邦强化学习的有限时间分析
机器学习
2024-04-16 v2 系统与控制
系统与控制
最优化与控制
摘要
联邦强化学习(FRL)已成为一种有前途的范式,通过利用来自不同智能体的信息来降低强化学习任务的样本复杂度。然而,当每个智能体与潜在不同的环境交互时,理论上对 FRL 算法的非渐近性能知之甚少。缺乏此类结果可归因于各种技术挑战及其复杂的相互作用:马尔可夫采样、线性函数近似、为节省通信而进行的多次局部更新、智能体 MDP 的奖励函数和转移核的异构性,以及连续的状态-动作空间。此外,在同策略设置中,行为策略随时间变化,进一步使分析复杂化。作为回应,我们引入了 FedSARSA,一种配备线性函数近似的新型联邦同策略强化学习方案,以应对这些挑战并提供全面的有限时间误差分析。值得注意的是,我们证明了 FedSARSA 收敛于对所有智能体近乎最优的策略,其近乎最优的程度与异构性水平成正比。此外,我们证明了 FedSARSA 利用智能体协作实现了随智能体数量增加的线性加速,这适用于固定和自适应步长配置。
引用
@article{arxiv.2401.15273,
title = {Finite-Time Analysis of On-Policy Heterogeneous Federated Reinforcement Learning},
author = {Chenyu Zhang and Han Wang and Aritra Mitra and James Anderson},
journal= {arXiv preprint arXiv:2401.15273},
year = {2024}
}
备注
Published as a conference paper at ICLR 2024