中文

机器学习系统中的隐私侧信道

密码学与安全 2024-07-19 v2 机器学习

摘要

当前大多数用于保护机器学习(ML)中隐私的方法都假设模型存在于真空中。然而在现实中,这些模型是更大系统的一部分,这些系统包含训练数据过滤、输出监控等组件。在这项工作中,我们引入了隐私侧信道:利用这些系统级组件以远高于独立模型原本可能实现的速率提取私有信息的攻击。我们提出了跨越整个 ML 生命周期(训练数据过滤、输入预处理、输出后处理以及查询过滤)的四类侧信道,并能够实现增强的成员推断、数据提取,甚至诸如提取用户测试查询等新型威胁。例如,我们展示了在应用差分隐私训练之前对训练数据进行去重会创建一个侧信道,该侧信道完全使任何可证明的隐私保证失效。我们进一步展示,那些阻止语言模型重新生成训练数据的系统可被利用来泄露训练集中包含的私钥——即使模型并未记忆这些密钥。综上所述,我们的结果表明需要对机器学习系统进行整体的端到端隐私分析。

关键词

引用

@article{arxiv.2309.05610,
  title  = {Privacy Side Channels in Machine Learning Systems},
  author = {Edoardo Debenedetti and Giorgio Severi and Nicholas Carlini and Christopher A. Choquette-Choo and Matthew Jagielski and Milad Nasr and Eric Wallace and Florian Tramèr},
  journal= {arXiv preprint arXiv:2309.05610},
  year   = {2024}
}

备注

USENIX Security 2024