中文

面向 ImageNet 规模的差分隐私训练

机器学习 2022-02-10 v2

摘要

差分隐私 (DP) 是在确保训练集中个体样本隐私的前提下训练机器学习 (ML) 模型(包括神经网络)的事实标准。尽管关于如何使用差分隐私训练 ML 模型的文献丰富,但以合理精度与隐私训练实际大规模神经网络仍极其困难。我们着手研究如何实现这一点,以 ImageNet 图像分类作为当前用 DP 精确解决极具挑战性的 ML 任务范例。本文分享我们工作中的初步经验,期望能启发并帮助其他研究者探索大规模 DP 训练。我们展示了可加速 DP 训练的方法,以及 DP 设定下倾向更优的模型类型与训练过程设置。综合所述方法,我们得以用 DP 训练 Resnet-18 达到 47.9%47.9\% 精度及隐私参数 ϵ=10,δ=106\epsilon = 10, \delta = 10^{-6}。相较 ImageNet 模型的“朴素” DP 训练,这是显著改进,但远不及同一网络在无隐私时可获得的 75%75\% 精度。我们使用的模型以 Places365 数据集预训练为起点。我们在 https://github.com/google-research/dp-imagenet 分享代码,呼吁他人基于此新基线进一步改进大规模 DP。

关键词

引用

@article{arxiv.2201.12328,
  title  = {Toward Training at ImageNet Scale with Differential Privacy},
  author = {Alexey Kurakin and Shuang Song and Steve Chien and Roxana Geambasu and Andreas Terzis and Abhradeep Thakurta},
  journal= {arXiv preprint arXiv:2201.12328},
  year   = {2022}
}

备注

25 pages, 7 figures. Code available at https://github.com/google-research/dp-imagenet