中文

对抗样本构成强毒药

机器学习 2021-06-22 v1 密码学与安全

摘要

对抗机器学习文献大体分为针对测试数据的规避攻击和针对训练数据的投毒攻击。本工作中,我们表明最初用于攻击预训练模型的对抗样本,比近期专门设计的投毒方法对数据投毒更为有效。我们的发现表明,当对抗样本被赋予其自然基图像的原始标签时,无法用于训练自然图像的分类器。此外,当对抗样本被赋予其对抗类别标签时,它们对训练是有用的。这表明对抗样本包含有用的语义内容,只是带有“错误”的标签(依据网络而非人类)。我们的方法——对抗投毒,比现有的用于安全数据集发布的投毒方法有效得多,并且我们发布了ImageNet的投毒版本ImageNet-P,以鼓励对这种数据混淆形式强度的研究。

关键词

引用

@article{arxiv.2106.10807,
  title  = {Adversarial Examples Make Strong Poisons},
  author = {Liam Fowl and Micah Goldblum and Ping-yeh Chiang and Jonas Geiping and Wojtek Czaja and Tom Goldstein},
  journal= {arXiv preprint arXiv:2106.10807},
  year   = {2021}
}