中文

基于低秩重参数化的大规模隐私学习

机器学习 2021-11-05 v4 密码学与安全

摘要

我们提出一种重参数化方案,以应对在大型神经网络上应用差分隐私 SGD 的挑战:1)存储个体梯度的巨大内存成本,2)所加噪声存在严重的维度依赖问题。具体而言,我们将每个权重矩阵用两个小维度的梯度承载(gradient-carrier)矩阵和一个残差权重(residual weight)矩阵重参数化。我们认为此种重参数化保持前向/反向过程不变,同时使我们无需直接计算梯度即可求得投影梯度。为进行差分隐私学习,我们设计了重参数化梯度扰动(RGP),其对梯度承载矩阵上的梯度加扰,并从带噪梯度重建原始权重的更新。重要的是,我们利用历史更新来寻找梯度承载矩阵,其最优性在线性回归下得到严格证明,并在深度学习任务中经实证验证。RGP 显著降低了内存成本并提升了效用。例如,我们首次能够将差分隐私应用于 BERT 模型,并在四个下游任务上以 ϵ=8\epsilon=8 取得平均准确率 83.9%83.9\%,相较非隐私基线损失在 5%5\% 以内,但享有低得多的隐私泄露风险。

关键词

引用

@article{arxiv.2106.09352,
  title  = {Large Scale Private Learning via Low-rank Reparametrization},
  author = {Da Yu and Huishuai Zhang and Wei Chen and Jian Yin and Tie-Yan Liu},
  journal= {arXiv preprint arXiv:2106.09352},
  year   = {2021}
}

备注

Published as a conference paper in International Conference on Machine Learning (ICML 2021). Source code available at https://github.com/dayu11/Differentially-Private-Deep-Learning