零冗余差分隐私分布式学习
机器学习
2023-11-21 v1 计算复杂性
密码学与安全
分布式、并行与集群计算
摘要
使用大模型的深度学习在广泛领域中取得了巨大成功。然而,在训练速度、内存成本和通信效率方面,训练这些拥有数十亿参数的模型非常具有挑战性,尤其是在差分隐私(DP)这一隐私保护机制下。一方面,DP优化在单个GPU上与标准非私有优化具有相当的效率,但在多个GPU上,现有的DP分布式学习(如流水线并行)效率显著更差。另一方面,零冗余优化器(ZeRO)是标准分布式学习的最先进解决方案,在大模型上展现出优异的训练效率,但将其与DP兼容在技术上是复杂的。本工作中,我们开发了一种新的系统解决方案DP-ZeRO:(I)扩大可训练的DP模型规模,例如至GPT-100B;(II)获得与标准ZeRO相同的计算与通信效率;(III)实现混合精度DP训练。我们的DP-ZeRO如同标准ZeRO一样,具有训练任意大小模型的潜力,并依据可训练参数量在世界上规模最大的DP模型上进行了评估。
引用
@article{arxiv.2311.11822,
title = {Zero redundancy distributed learning with differential privacy},
author = {Zhiqi Bu and Justin Chiu and Ruixuan Liu and Sheng Zha and George Karypis},
journal= {arXiv preprint arXiv:2311.11822},
year = {2023}
}