中文

零冗余差分隐私分布式学习

机器学习 2023-11-21 v1 计算复杂性 密码学与安全 分布式、并行与集群计算

摘要

使用大模型的深度学习在广泛领域中取得了巨大成功。然而,在训练速度、内存成本和通信效率方面,训练这些拥有数十亿参数的模型非常具有挑战性,尤其是在差分隐私(DP)这一隐私保护机制下。一方面,DP优化在单个GPU上与标准非私有优化具有相当的效率,但在多个GPU上,现有的DP分布式学习(如流水线并行)效率显著更差。另一方面,零冗余优化器(ZeRO)是标准分布式学习的最先进解决方案,在大模型上展现出优异的训练效率,但将其与DP兼容在技术上是复杂的。本工作中,我们开发了一种新的系统解决方案DP-ZeRO:(I)扩大可训练的DP模型规模,例如至GPT-100B;(II)获得与标准ZeRO相同的计算与通信效率;(III)实现混合精度DP训练。我们的DP-ZeRO如同标准ZeRO一样,具有训练任意大小模型的潜力,并依据可训练参数量在世界上规模最大的DP模型上进行了评估。

关键词

引用

@article{arxiv.2311.11822,
  title  = {Zero redundancy distributed learning with differential privacy},
  author = {Zhiqi Bu and Justin Chiu and Ruixuan Liu and Sheng Zha and George Karypis},
  journal= {arXiv preprint arXiv:2311.11822},
  year   = {2023}
}