中文

跨异构环境的单循环联邦演员-评论家算法

机器学习 2024-12-25 v1 分布式、并行与集群计算 多智能体系统

摘要

联邦强化学习(FRL)已成为一种有前景的范式,使多个智能体能够协作学习一个可适应异构环境的共享策略。在各种强化学习(RL)算法中,演员-评论家(AC)算法因其低方差和高样本效率而脱颖而出。然而,关于AC在联邦方式下的理论几乎一无所知,特别是当每个智能体与可能不同的环境交互时。缺乏这种结果归因于各种技术挑战:说明演员和评论家之间耦合效应的两层结构、异构环境、马尔可夫采样和多次局部更新。为此,我们研究了单循环联邦演员-评论家(SFAC),其中智能体在两层联邦方式下进行演员-评论家学习,同时与异构环境交互。然后我们给出了SFAC收敛误差的界。结果表明,收敛误差渐近收敛到近稳定点,其程度与环境异质性成正比。此外,样本复杂度通过智能体的联邦实现了线性加速。我们通过使用常见RL基准的数值实验评估了SFAC的性能,证明了其有效性。

关键词

引用

@article{arxiv.2412.14555,
  title  = {Single-Loop Federated Actor-Critic across Heterogeneous Environments},
  author = {Ye Zhu and Xiaowen Gong},
  journal= {arXiv preprint arXiv:2412.14555},
  year   = {2024}
}

备注

Extended version of paper accepted at AAAI'25