使用 GAN 判别器检测脏标签与干净标签攻击
计算机视觉与模式识别
2025-06-05 v2 图像与视频处理
摘要
收集足够的图像来训练深度计算机视觉模型是一项持续的挑战。不幸的是,除非对图像进行适当检查,否则从未知来源收集图像会使模型行为面临被脏标签或干净标签攻击操纵的风险。手动检查每个图像-标签对是不切实际的,而涉及重新训练模型的常见中毒检测方法可能非常耗时。本研究使用 GAN 判别器来保护单一类别免受错误标签和不同级别修改图像的影响。还包含了所述扰动对基本卷积神经网络分类器的影响以供参考。结果表明,在单一类别上训练后,GAN 判别器的置信度得分可以提供一个阈值来识别错误标记的图像,并在使用类内样本进行决策阈值校准后,从扰动 epsilon 幅度为 0.20 开始,识别出 100\% 的测试中毒样本。开发人员可以使用本报告作为基础,训练自己的判别器以保护其 CV 模型中的高价值类别。
引用
@article{arxiv.2506.01224,
title = {Dirty and Clean-Label attack detection using GAN discriminators},
author = {John W. Smutny},
journal= {arXiv preprint arXiv:2506.01224},
year = {2025}
}
备注
13 pages total. Appendix starts on page 10