Trainwreck:一种破坏性的图像分类器对抗攻击
计算机视觉与模式识别
2024-06-12 v2 密码学与安全
机器学习
摘要
对抗攻击是计算机视觉(CV)的一个重要安全问题。随着CV模型在应用实践中成为日益宝贵的资产,扰乱它们正成为一种经济破坏形式。本文开启了对旨在损害目标CV模型的破坏性对抗攻击(DAA)的探索。DAA通过定义威胁模型、DAA最大化的代价函数,并设定三项成功要求(效力、隐蔽性、可定制性)而形式化。作为先驱DAA,本文提出Trainwreck,一种训练时攻击,它利用从替代模型获得的隐蔽()类对通用扰动,混淆训练数据中相似类别的数据。Trainwreck是一种黑盒、可迁移的攻击:它不需要目标架构的知识,且单一中毒数据集会降低任何在其上训练的模型的性能。在CIFAR-10与CIFAR-100及各种模型架构(EfficientNetV2、ResNeXt-101及微调的ViT-L-16)上的实验评估证明了Trainwreck的效率。与数据投毒最优方法相比,Trainwreck取得相似或更好的效力,且通过投毒率参数完全可定制。最后,基于哈希的数据冗余被确定为针对Trainwreck或类似DAA的可靠防御。代码见https://github.com/JanZahalka/trainwreck。
引用
@article{arxiv.2311.14772,
title = {Trainwreck: A damaging adversarial attack on image classifiers},
author = {Jan Zahálka},
journal= {arXiv preprint arXiv:2311.14772},
year = {2024}
}