如何使机器学习具备差分隐私:一份实用指南
机器学习
2023-08-02 v3 密码学与安全
机器学习
摘要
ML模型在现实应用中无处不在,并且一直是研究的焦点。与此同时,学界已开始意识到保护ML训练数据隐私的重要性。差分隐私(DP)已成为对数据匿名化做出形式化声明的黄金标准。然而,尽管业界已有所采用,但将DP应用于现实世界中复杂ML模型的尝试仍然寥寥无几。DP的采用受到以下因素阻碍:关于DP保护含义的实用指导有限、缺乏明确的隐私保障目标,以及难以在ML模型上实现良好的隐私-效用-计算权衡。调优和最大化性能的诀窍散落在论文中或存于从业者的脑海。此外,文献似乎就如何以及是否应用架构调整、哪些组件与DP配合“安全”给出了相互矛盾的证据。本工作是自包含的指南,深入概述DP ML领域,并提供有关在严格隐私保障下实现最佳DP ML模型的信息。我们的目标读者既包括研究者也包括从业者。对ML的DP感兴趣的研究者将受益于对当前进展与待改进领域的清晰概述。我们包含以理论为导向的章节,强调重要主题如隐私核算及其假设、收敛性。对从业者,我们提供DP理论背景以及清晰的分步指南,用于选择适当的隐私定义与方法、实现DP训练、可能更新模型架构以及调优超参数。对研究者和从业者而言,持续且完整地报告隐私保障都至关重要,因此我们提出一套陈述保障的具体最佳实践。
引用
@article{arxiv.2303.00654,
title = {How to DP-fy ML: A Practical Guide to Machine Learning with Differential Privacy},
author = {Natalia Ponomareva and Hussein Hazimeh and Alex Kurakin and Zheng Xu and Carson Denison and H. Brendan McMahan and Sergei Vassilvitskii and Steve Chien and Abhradeep Thakurta},
journal= {arXiv preprint arXiv:2303.00654},
year = {2023}
}