利用扩散去噪实现针对干净标签投毒攻击的认证鲁棒性
密码学与安全
2025-06-03 v2 计算机视觉与模式识别
机器学习
摘要
我们提出了一种在 范数下针对干净标签投毒攻击的认证防御方法。此类攻击通过向训练数据中注入少量(例如 1%)包含有界对抗扰动的投毒样本,诱导测试输入发生目标误分类。受 所实现的对抗鲁棒性的启发,我们展示了如何利用现成的扩散去噪模型来净化被篡改的训练数据。我们在 和 范数下广泛测试了该防御方法对七种干净标签投毒攻击的防御效果,在测试准确率仅有可忽略下降的情况下,将攻击成功率降至 0-16%。我们将该防御与现有的针对干净标签投毒的对抗措施进行了比较,结果表明该防御最大程度地降低了攻击成功率,并提供了最佳的模型效用。我们的结果突显了未来开发更强干净标签攻击的必要性,并建议将我们这种实用且经认证的防御作为评估这些攻击的强基线。
引用
@article{arxiv.2403.11981,
title = {Certified Robustness to Clean-Label Poisoning Using Diffusion Denoising},
author = {Sanghyun Hong and Nicholas Carlini and Alexey Kurakin},
journal= {arXiv preprint arXiv:2403.11981},
year = {2025}
}