中文

基于共享表征的个性化联邦强化学习的线性加速

机器学习 2025-07-18 v2 最优化与控制 机器学习

摘要

联邦强化学习 (FedRL) 使多个智能体能够在不共享其在智能体-环境相互作用期间收集的本地轨迹的情况下协作学习策略。然而,实际情况下,不同智能体所面临的环境往往是异构的,导致现有 FedRL 算法在单个智能体上学习的单一策略表现不佳。在本文中,我们进一步一步引入一种基于可能在异构环境中共享的常见结构的\emph{个性化} FedRL 框架 (PFedRL)。具体而言,我们发展了一类 PFedRL 算法,命名为 PFedRL-Rep,通过学习 (1) 在所有智能体之间协作学习的共享特征表征,以及 (2) 个针对其本地环境的特定于智能体的权重向量。我们分析了 PFedTD-Rep,即该框架中一种具有时间差 (TD) 学习和线性表征的实例的收敛性。据我们所知,我们是首次在 PFedRL 设置下证明了 PFedRL 的线性收敛加速。为实现此目标,我们表明 PFedTD-Rep 是联邦两时序随机逼近的一个例子,其中具有马尔可夫噪声。实验结果表明,PFedTD-Rep 以及基于深度 Q 网络 (DQN) 的扩展,不仅在异构环境中改进了学习,还能更好地对新环境进行泛化。

关键词

引用

@article{arxiv.2411.15014,
  title  = {On the Linear Speedup of Personalized Federated Reinforcement Learning with Shared Representations},
  author = {Guojun Xiong and Shufan Wang and Daniel Jiang and Jian Li},
  journal= {arXiv preprint arXiv:2411.15014},
  year   = {2025}
}

备注

ICLR 2025