中文

时变有向网络上的去中心化超梯度计算

机器学习 2023-06-14 v3 机器学习

摘要

本文解决去中心化联邦学习(FL)中估计超梯度时的通信问题。去中心化FL中的超梯度量化了客户端超参数扰动对全局共享最优模型性能的影响。在先前工作中,客户端通过在静态无向网络上通信Hessian矩阵来追踪该影响,导致(i)过高的通信成本以及(ii)无法利用更高效且鲁棒的网络,即时变有向网络。为解决这些问题,我们借助对模型参数与梯度的平均操作,为FL引入一种替代的最优性条件。随后我们采用Push-Sum作为平均操作,这是一种面向时变有向网络的共识优化技术。结果,由我们的最优性条件导出的超梯度估计器具备两个理想性质:(i)仅需向量的Push-Sum通信;(ii)可在时变有向网络上运行。我们从理论与实证上确认了该估计器收敛到真实超梯度,并进一步展示其支持两种新应用:时变网络上的去中心化影响估计与个性化。

关键词

引用

@article{arxiv.2210.02129,
  title  = {Decentralized Hyper-Gradient Computation over Time-Varying Directed Networks},
  author = {Naoyuki Terashita and Satoshi Hara},
  journal= {arXiv preprint arXiv:2210.02129},
  year   = {2023}
}

备注

Under review