中文

DP-InstaHide:利用差分隐私数据增强可证明地化解投毒与后门攻击

机器学习 2021-04-09 v2 密码学与安全 计算机视觉与模式识别

摘要

数据投毒和后门攻击通过操纵训练数据来引发受害者模型的安全漏洞。这些攻击可利用差分隐私(DP)训练方法被可证明地抵御,尽管这会带来模型性能的急剧下降。InstaHide 方法最近被提出作为 DP 训练的替代方案,其利用了 mixup 增强所谓的隐私特性,但缺乏严格保证。在这项工作中,我们表明强大的数据增强(如 mixup 和随机加性噪声)可消除投毒攻击,同时仅承受较小的精度折衷。为解释这些发现,我们提出了一种训练方法 DP-InstaHide,它将 mixup 正则化与加性噪声结合。对 DP-InstaHide 的严格分析表明,mixup 确实具有隐私优势,且使用 k-way mixup 训练可证明地产生比朴素 DP 机制至少强 k 倍的差分隐私保证。由于 mixup(相对于噪声)有益于模型性能,DP-InstaHide 提供了一种比其他已知 DP 方法更强的针对投毒攻击的经验性能机制。

关键词

引用

@article{arxiv.2103.02079,
  title  = {DP-InstaHide: Provably Defusing Poisoning and Backdoor Attacks with Differentially Private Data Augmentations},
  author = {Eitan Borgnia and Jonas Geiping and Valeriia Cherepanova and Liam Fowl and Arjun Gupta and Amin Ghiasi and Furong Huang and Micah Goldblum and Tom Goldstein},
  journal= {arXiv preprint arXiv:2103.02079},
  year   = {2021}
}

备注

11 pages, 5 figures