中文

隐私后门:利用受损的预训练模型窃取数据

密码学与安全 2024-04-02 v1 机器学习

摘要

从业者通常从开放存储库下载预训练机器学习模型,并对其进行微调以适应特定应用。我们表明,这种做法引入了一种新的隐私后门风险。通过篡改预训练模型的权重,攻击者可以完全损害微调数据的隐私。我们展示了如何为包括 Transformer 在内的多种模型构建隐私后门,使攻击者能够以有保证的成功率重建单个微调样本!我们进一步表明,后门模型允许对使用差分隐私(DP)训练的模型进行严密的隐私攻击。因此,如果模型不受信任,以宽松隐私保证训练 DP 模型的常见乐观做法是不安全的。总体而言,我们的工作强调了一种针对机器学习隐私的关键且被忽视的供应链攻击。

关键词

引用

@article{arxiv.2404.00473,
  title  = {Privacy Backdoors: Stealing Data with Corrupted Pretrained Models},
  author = {Shanglun Feng and Florian Tramèr},
  journal= {arXiv preprint arXiv:2404.00473},
  year   = {2024}
}

备注

Code at https://github.com/ShanglunFengatETHZ/PrivacyBackdoor