收敛更快,通信更少:Hessian 信息联邦零阶优化
机器学习
2026-02-03 v2 分布式、并行与集群计算
摘要
零阶优化在联邦学习中实现了与维度无关的通信,由于显著的通信节省,使其对大语言模型的微调极具吸引力。然而,现有的 ZO-FL 方法在很大程度上忽略了曲率信息,尽管曲率信息对加速收敛的益处已得到充分证实。为解决此问题,我们提出了 HiSo,一种 Hessian 信息 ZO 联邦优化方法,该方法通过利用全局对角 Hessian 近似来加速收敛,同时严格保持仅标量通信,不传输任何二阶信息。在理论上,对于非凸函数,我们证明了在某些 Hessian 近似假设下,HiSo 能够实现独立于 Lipschitz 常数 和模型维度 的加速收敛速率,为观察到的 ZO 收敛远快于其最坏情况 界限的现象提供了合理解释。在实验上,在多样化的 LLM 微调基准中,HiSo 相比现有 SOTA ZO-FL 基线在通信轮次上实现了 15 的加速。这种卓越的收敛性不仅降低了通信成本,还提供了强有力的实验证据,表明 Hessian 信息在联邦 ZO 优化设置中充当了有效的加速器。我们的源代码可在 https://github.com/ZidongLiu/DeComFL 获取。
引用
@article{arxiv.2506.02370,
title = {Converge Faster, Talk Less: Hessian-Informed Federated Zeroth-Order Optimization},
author = {Zhe Li and Bicheng Ying and Zidong Liu and Chaosheng Dong and Haibo Yang},
journal= {arXiv preprint arXiv:2506.02370},
year = {2026}
}
备注
Accepted by ICLR 2026