中文

NanoBatch Privacy:在 IPU 上实现快速差分隐私学习

机器学习 2022-06-06 v2 密码学与安全 计算机视觉与模式识别 分布式、并行与集群计算

摘要

差分隐私 SGD(DPSGD)近期在深度学习中展现出前景。然而,与非隐私 SGD 相比,DPSGD 算法带来的计算开销可能抵消 GPU 中批处理的优势。微批处理(micro-batching)是一种常用的缓解方法,并在 TensorFlow Privacy 库(TFDP)中得到完全支持。但它会降低准确率。我们提出 NanoBatch Privacy,作为 TFDP 的轻量级附加模块,通过在 Graphcore IPU 上利用批大小为 1(无微批处理)和梯度累积来使用。这使我们能够以对吞吐量最小的影响实现较大的总批大小。其次,我们使用 Cifar-10 说明从隐私与效用的角度看,较大的批大小未必是最优的。在 ImageNet 上,我们相比 TFDP 在 8 块 A100 上实现了超过 15 倍的加速,即便相对于 Opacus 等库也有显著加速。我们还提供两个扩展:1)用于流水线模型的 DPSGD;2)逐层裁剪,在 8 块 A100 上比 Opacus 实现快 15 倍。最后作为一个应用案例研究,我们将 NanoBatch 训练应用于私有的 Covid-19 胸部 CT 预测。

关键词

引用

@article{arxiv.2109.12191,
  title  = {NanoBatch Privacy: Enabling fast Differentially Private learning on the IPU},
  author = {Edward H. Lee and Mario Michael Krell and Alexander Tsyplikhin and Victoria Rege and Errol Colak and Kristen W. Yeom},
  journal= {arXiv preprint arXiv:2109.12191},
  year   = {2022}
}