中文

深度划分聚合:针对通用投毒攻击的可证明防御

机器学习 2021-03-19 v2 机器学习

摘要

对抗性投毒攻击通过扭曲训练数据来破坏分类器在测试时的行为。可证明防御为每个测试样本提供一个证书,即能够破坏该测试样本分类的任何对训练集的对抗性扭曲幅度的下界。我们提出两种针对投毒攻击的新型可证明防御:(i) 深度划分聚合(DPA),一种针对通用投毒威胁模型的可证明防御,该模型定义为向训练集插入或删除有界数量的样本——由此推论,该威胁模型也包括对有界数量图像和/或标签的任意扭曲;以及 (ii) 半监督 DPA(SS-DPA),一种针对标签翻转投毒攻击的可证明防御。DPA 是一种集成方法,其中基模型在由哈希函数确定的训练集划分上训练。DPA 既与经典机器学习中研究充分的子集聚合这一集成方法相关,也与针对规避攻击的流行可证明防御随机平滑相关。我们针对标签翻转攻击的防御 SS-DPA,使用半监督学习算法作为其基分类器模型:每个基分类器除了使用某个划分的标签外,还使用整个无标签训练集进行训练。SS-DPA 在 MNIST 和 CIFAR-10 上显著优于现有的标签翻转攻击可证明防御:对于至少一半的测试图像,在 MNIST 上可证明容忍超过 600 次标签翻转(对比 < 200 次),在 CIFAR-10 上超过 300 次(对比 175 次)。在尚无先前可证明防御的通用投毒攻击下,DPA 能够针对 MNIST 上超过 500 次毒化图像插入以及 CIFAR-10 上 9 次插入,为 >= 50% 的测试图像提供证书。这些结果确立了针对投毒攻击的新最优(SOTA)可证明防御。

关键词

引用

@article{arxiv.2006.14768,
  title  = {Deep Partition Aggregation: Provable Defense against General Poisoning Attacks},
  author = {Alexander Levine and Soheil Feizi},
  journal= {arXiv preprint arXiv:2006.14768},
  year   = {2021}
}

备注

ICLR 2021