中文

利用扩散去噪实现针对干净标签投毒攻击的认证鲁棒性

密码学与安全 2025-06-03 v2 计算机视觉与模式识别 机器学习

摘要

我们提出了一种在 2\ell_2 范数下针对干净标签投毒攻击的认证防御方法。此类攻击通过向训练数据中注入少量(例如 1%)包含有界对抗扰动的投毒样本,诱导测试输入发生目标误分类。受 randomizedrandomized smoothingsmoothing 所实现的对抗鲁棒性的启发,我们展示了如何利用现成的扩散去噪模型来净化被篡改的训练数据。我们在 2\ell_2\ell_{\infty} 范数下广泛测试了该防御方法对七种干净标签投毒攻击的防御效果,在测试准确率仅有可忽略下降的情况下,将攻击成功率降至 0-16%。我们将该防御与现有的针对干净标签投毒的对抗措施进行了比较,结果表明该防御最大程度地降低了攻击成功率,并提供了最佳的模型效用。我们的结果突显了未来开发更强干净标签攻击的必要性,并建议将我们这种实用且经认证的防御作为评估这些攻击的强基线。

关键词

引用

@article{arxiv.2403.11981,
  title  = {Certified Robustness to Clean-Label Poisoning Using Diffusion Denoising},
  author = {Sanghyun Hong and Nicholas Carlini and Alexey Kurakin},
  journal= {arXiv preprint arXiv:2403.11981},
  year   = {2025}
}