中文

关于拜占庭鲁棒分布式学习的最优批大小

机器学习 2023-05-24 v1 最优化与控制 机器学习

摘要

拜占庭鲁棒分布式学习(BRDL)中,计算设备可能因意外故障或恶意攻击而出现异常行为,近来已成为热门研究课题。然而,即使在独立同分布(i.i.d.)情况下,现有BRDL方法也会因随机梯度的较大方差而导致模型精度显著下降。增大批大小是一种简单而有效的降低方差的方法。然而,当梯度计算总量固定时,过大的批大小会导致迭代次数(更新次数)过少,这同样可能降低模型精度。鉴于此挑战,我们在本工作中主要研究在梯度计算总量固定时的最优批大小。具体而言,我们从理论和实验上表明,当梯度计算总量固定时,BRDL中的最优批大小随拜占庭工作节点比例的增加而增大。因此,与无攻击情况相比,在拜占庭攻击下应将批大小设置得更大。然而,对于现有BRDL方法,即使没有拜占庭攻击,大批量也会导致模型精度下降。为应对该问题,我们提出了一种称为带归一化动量的拜占庭鲁棒随机梯度下降(ByzSGDnm)的新型BRDL方法,其能缓解大批量情形下的模型精度下降。此外,我们从理论上证明了ByzSGDnm在拜占庭攻击下对一般非凸情形的收敛性。实验结果表明,ByzSGDnm在比特翻转故障下与现有BRDL方法性能相当,但在精心设计的攻击下优于现有BRDL方法。

关键词

引用

@article{arxiv.2305.13856,
  title  = {On the Optimal Batch Size for Byzantine-Robust Distributed Learning},
  author = {Yi-Rui Yang and Chang-Wei Shi and Wu-Jun Li},
  journal= {arXiv preprint arXiv:2305.13856},
  year   = {2023}
}