中文

平滑损失函数的联邦优化

机器学习 2024-01-05 v2 最优化与控制 统计理论 机器学习 统计理论

摘要

在本工作中,我们研究联邦学习框架内的经验风险最小化(ERM),其中中央服务器使用存储在 mm 个客户端上的训练数据来最小化 ERM 目标函数。在此设置下,Federated Averaging(FedAve,联邦平均)算法是确定 ERM 问题 ϵ\epsilon-近似解的主要方法。与标准优化算法类似,FedAve 的收敛性分析仅依赖于损失函数在优化参数上的光滑性。然而,损失函数在训练数据上往往也非常光滑。为利用这一额外的光滑性,我们提出 Federated Low Rank Gradient Descent(FedLRGD,联邦低秩梯度下降)算法。由于数据中的光滑性在损失函数上诱导出近似低秩结构,我们的方法首先在服务端和客户端之间进行几轮通信以学习权重,服务器可用其近似客户端的梯度。然后,我们的方法在服务器端使用不精确梯度下降求解 ERM 问题。为表明 FedLRGD 可能优于 FedAve,我们提出联邦预言复杂度的概念作为标准预言复杂度的对应物。在关于损失函数的一些假设下(例如参数上的强凸性、数据上的 η\eta-Hölder 光滑性等),我们证明 FedLRGD 的联邦预言复杂度量级为 ϕm(p/ϵ)Θ(d/η)\phi m(p/\epsilon)^{\Theta(d/\eta)},而 FedAve 的量级为 ϕm(p/ϵ)3/4\phi m(p/\epsilon)^{3/4}(忽略次主导因子),其中 ϕ1\phi\gg 1 为“通信-计算比”,pp 为参数维度,dd 为数据维度。进而我们表明,当 dd 较小且损失函数在数据上足够光滑时,FedLRGD 在联邦预言复杂度上击败 FedAve。最后,在分析 FedLRGD 的过程中,我们还建立了关于潜变量模型低秩近似的一个结果。

关键词

引用

@article{arxiv.2201.01954,
  title  = {Federated Optimization of Smooth Loss Functions},
  author = {Ali Jadbabaie and Anuran Makur and Devavrat Shah},
  journal= {arXiv preprint arXiv:2201.01954},
  year   = {2024}
}

备注

31 pages, double column format, 2 figures