无需额外模型的无监督对抗检测:训练损失应当改变
机器学习
2023-08-08 v1
摘要
对抗鲁棒性是在实际部署深度学习模型时面临的关键挑战。传统的对抗训练与有监督检测方法依赖于攻击类型的先验知识与带标签训练数据,而这往往不切实际。现有的无监督对抗检测方法识别目标模型是否正常工作,但由于使用依赖不必要特征并加剧对抗攻击的常规交叉熵训练损失,其准确率不佳。我们提出新的训练损失以减少无用特征,以及相应的无需对抗攻击先验知识的检测方法。针对所有给定白盒攻击的检测率(真正例率)除无限制攻击(DF())外均高于 93.9%,而假正例率仅为 2.5%。所提方法在所有被测攻击类型中表现良好,且假正例率甚至优于擅长特定类型的方法。
引用
@article{arxiv.2308.03243,
title = {Unsupervised Adversarial Detection without Extra Model: Training Loss Should Change},
author = {Chien Cheng Chyou and Hung-Ting Su and Winston H. Hsu},
journal= {arXiv preprint arXiv:2308.03243},
year = {2023}
}
备注
AdvML in ICML 2023 code:https://github.com/CycleBooster/Unsupervised-adversarial-detection-without-extra-model