中文

面向 $(L_0, L_1)$-平滑性下的鲁棒优化

机器学习 2026-03-16 v1

摘要

我们考虑在 (L0,L1)(L_0, L_1)-平滑性存在下的分布式优化问题中的拜占庭攻击。(L0,L1)(L_0, L_1)-平滑性是标准 LL-平滑性的一种推广,能够捕捉到状态相关梯度 Lipschitz 常数变化的函数。我们提出了 Byz-NSGDM 方法,这是一种带动量的归一化随机梯度下降法,能够对抗拜占庭工人的攻击,同时保持收敛保证。该算法将动量归一化与由最近邻混合 (NNM) 提升的拜占庭鲁棒聚合相结合,以处理 (L0,L1)(L_0, L_1)-平滑性和拜占庭对手所带来的挑战。我们证明 Byz-NSGDM 的收敛率为 O(K1/4)O(K^{-1/4}),其收敛精度受鲁棒系数和梯度异质性比例的拜占庭偏置底层限制。在异构 MNIST 分类、合成 (L0,L1)(L_0, L_1)-平滑优化以及小型 GPT 模型的字符级语言建模等实验中,验证了本方法在应对各种拜占庭攻击策略方面的有效性。还通过消融实验表明,Byz-NSGDM 在广泛的动量和学习率选择下均保持鲁棒性。

关键词

引用

@article{arxiv.2603.12512,
  title  = {Byzantine-Robust Optimization under $(L_0, L_1)$-Smoothness},
  author = {Arman Bolatov and Samuel Horváth and Martin Takáč and Eduard Gorbunov},
  journal= {arXiv preprint arXiv:2603.12512},
  year   = {2026}
}

备注

10 pages, 1 table, 4 figures, accepted to CPAL 2026