中文

去中心化联邦策略梯度:拜占庭容错与可证明的快速收敛

机器学习 2024-01-09 v1 人工智能 分布式、并行与集群计算 多智能体系统

摘要

在联邦强化学习(FRL)中,智能体旨在协作学习一个共同任务,同时每个智能体在其本地环境中行动,不交换原始轨迹。现有的FRL方法要么(a)不提供任何针对恶意智能体的容错保证,要么(b)依赖一个可信的中心智能体(单点故障)来聚合更新。我们提出了首个去中心化的拜占庭容错FRL方法。为此,我们首先提出了一种新的中心化拜占庭容错策略梯度(PG)算法,该算法仅依赖非容错PG的标准假设,从而优于现有方法。然后,作为我们的主要贡献,我们展示了如何利用鲁棒聚合和拜占庭弹性共识方法的组合来消除对可信中心实体的需求。由于我们的结果代表了拜占庭容错去中心化联邦非凸优化的首次样本复杂度分析,我们的技术贡献可能具有独立意义。最后,我们在常见的强化学习环境中通过实验验证了我们的理论结果,展示了去中心化联邦相对于参与智能体数量的加速效果以及对各种拜占庭攻击的鲁棒性。

关键词

引用

@article{arxiv.2401.03489,
  title  = {Decentralized Federated Policy Gradient with Byzantine Fault-Tolerance and Provably Fast Convergence},
  author = {Philip Jordan and Florian Grötschla and Flint Xiaofeng Fan and Roger Wattenhofer},
  journal= {arXiv preprint arXiv:2401.03489},
  year   = {2024}
}

备注

Accepted at AAMAS'24