以友好噪声对抗对抗噪声:一种抵御数据投毒攻击的强大防御
密码学与安全
2023-07-21 v4 机器学习
摘要
一类强大的(不可见的)数据投毒攻击通过小的对抗扰动修改部分训练样本,以改变某些测试时数据的预测。现有的防御机制在实践中并不理想,因为它们往往要么严重损害泛化性能,要么是特定于攻击的,且应用起来极其缓慢。在此,我们提出一种简单但高效的方法,与现有方法不同,它以极微小的泛化性能下降打破了各类不可见投毒攻击。我们观察到关键现象:攻击引入了高训练损失的局部尖锐区域,当这些区域被最小化时,会导致对抗扰动被学习并使攻击成功。为打破投毒攻击,我们的核心思想是缓解由投毒样本引入的尖锐损失区域。为此,我们的方法包含两个组件:一个优化的友好噪声,其被生成以最大程度扰动样本而不降低性能;以及一个随机变化的噪声组件。这两个组件的结合构建了一种极轻量却极其有效的防御,可抵御最强大的无触发目标型和隐藏触发后门投毒攻击,包括 Gradient Matching、Bulls-eye Polytope 和 Sleeper Agent。我们展示了我们的友好噪声可迁移到其他架构,且自适应攻击因其随机噪声组件而无法打破我们的防御。我们的代码可在 https://github.com/tianyu139/friendly-noise 获取。
引用
@article{arxiv.2208.10224,
title = {Friendly Noise against Adversarial Noise: A Powerful Defense against Data Poisoning Attacks},
author = {Tian Yu Liu and Yu Yang and Baharan Mirzasoleiman},
journal= {arXiv preprint arXiv:2208.10224},
year = {2023}
}
备注
Code available at: https://github.com/tianyu139/friendly-noise