仅需标签投毒
机器学习
2023-10-31 v1 密码学与安全
计算机视觉与模式识别
摘要
在后门攻击中,攻击者向模型的训练数据集中注入损坏数据,以便对带有特定攻击者定义触发器的图像预测获得控制。一个典型的损坏训练样本需要同时改变图像(通过施加触发器)和标签。因此,在干净图像上训练的模型被认为可免受后门攻击。然而,在一些常见的机器学习场景中,训练标签由潜在恶意的第三方提供。这包括众包标注和知识蒸馏。因此,我们研究一个基本问题:我们能否仅通过破坏标签来发起成功的后门攻击?我们介绍了一种设计仅标签后门攻击的新方法,称之为 FLIP,并在三个数据集(CIFAR-10、CIFAR-100 和 Tiny-ImageNet)和四种架构(ResNet-32、ResNet-18、VGG-19 和 Vision Transformer)上展示了其优势。仅破坏 2% 的 CIFAR-10 标签,FLIP 实现了 99.4% 的近乎完美的攻击成功率,同时干净测试准确率仅下降 1.8%。我们的方法建立在近期轨迹匹配(最初为数据集蒸馏而引入)的进展之上。
引用
@article{arxiv.2310.18933,
title = {Label Poisoning is All You Need},
author = {Rishi D. Jha and Jonathan Hayase and Sewoong Oh},
journal= {arXiv preprint arXiv:2310.18933},
year = {2023}
}