中文

Trainwreck:一种破坏性的图像分类器对抗攻击

计算机视觉与模式识别 2024-06-12 v2 密码学与安全 机器学习

摘要

对抗攻击是计算机视觉(CV)的一个重要安全问题。随着CV模型在应用实践中成为日益宝贵的资产,扰乱它们正成为一种经济破坏形式。本文开启了对旨在损害目标CV模型的破坏性对抗攻击(DAA)的探索。DAA通过定义威胁模型、DAA最大化的代价函数,并设定三项成功要求(效力、隐蔽性、可定制性)而形式化。作为先驱DAA,本文提出Trainwreck,一种训练时攻击,它利用从替代模型获得的隐蔽(ϵ8/255\epsilon \leq 8/255)类对通用扰动,混淆训练数据中相似类别的数据。Trainwreck是一种黑盒、可迁移的攻击:它不需要目标架构的知识,且单一中毒数据集会降低任何在其上训练的模型的性能。在CIFAR-10与CIFAR-100及各种模型架构(EfficientNetV2、ResNeXt-101及微调的ViT-L-16)上的实验评估证明了Trainwreck的效率。与数据投毒最优方法相比,Trainwreck取得相似或更好的效力,且通过投毒率参数完全可定制。最后,基于哈希的数据冗余被确定为针对Trainwreck或类似DAA的可靠防御。代码见https://github.com/JanZahalka/trainwreck。

关键词

引用

@article{arxiv.2311.14772,
  title  = {Trainwreck: A damaging adversarial attack on image classifiers},
  author = {Jan Zahálka},
  journal= {arXiv preprint arXiv:2311.14772},
  year   = {2024}
}