干净图像后门攻击
计算机视觉与模式识别
2025-11-11 v2 密码学与安全
摘要
为获取大量标注训练数据以构建高性能图像分类模型,许多公司选择委托第三方为其无标签数据进行标注。即使存在少量标注错误,这种做法仍被普遍认为是安全的,因为这些微小误差对模型最终性能的影响可忽略不计,且现有后门攻击需要攻击者具备污染训练图像的能力。然而,本文提出干净图像后门攻击,揭示后门仍可通过部分错误标签注入,而无需修改训练图像。具体而言,攻击者首先寻找一个触发特征,将训练图像分为两部分:具有该特征的图像和不具有该特征的图像。随后,攻击者将前一部分图像的标签篡改为后门类别。模型在被污染数据上训练后,后门最终被植入目标模型。在推理阶段,攻击者可通过两种方式激活后门:轻微修改输入图像以获得触发特征,或直接使用天然具有该触发特征的图像作为输入。我们进行了大量实验以证明攻击的有效性和实用性。实验结果表明,我们的攻击严重危害了图像分类模型的公平性和鲁棒性,有必要对外包标注中的错误标签保持警惕。
引用
@article{arxiv.2403.15010,
title = {Clean-image Backdoor Attacks},
author = {Dazhong Rong and Guoyao Yu and Shuheng Shen and Xinyi Fu and Peng Qian and Jianhai Chen and Qinming He and Xing Fu and Weiqiang Wang},
journal= {arXiv preprint arXiv:2403.15010},
year = {2025}
}