论差分隐私优化中分组裁剪的精度与效率
机器学习
2023-10-31 v1 计算复杂性
密码学与安全
摘要
近期的进展显著提升了差分隐私(DP)深度学习的精度、内存开销与训练速度,尤其针对具有数百万至数十亿参数的大型视觉与语言模型。本工作中,我们深入研究了逐样本梯度裁剪方式——DP 优化中的关键组件。我们表明不同的裁剪方式具有相同的时间复杂度,但体现了一种精度-内存权衡:尽管全层裁剪(粗粒度)最为普遍且通常给出最佳精度,但相较于其他分组裁剪(如层间裁剪(细粒度))会带来更高的内存开销。我们通过收敛理论与复杂度分析将该权衡形式化。重要的是,我们证明对于更大的模型,分组裁剪与全层裁剪之间的精度差距变小,而分组裁剪的内存优势依然存在。因此,分组裁剪使得大型模型的 DP 优化能够同时实现高精度与低峰值内存。
引用
@article{arxiv.2310.19215,
title = {On the accuracy and efficiency of group-wise clipping in differentially private optimization},
author = {Zhiqi Bu and Ruixuan Liu and Yu-Xiang Wang and Sheng Zha and George Karypis},
journal= {arXiv preprint arXiv:2310.19215},
year = {2023}
}