通用士兵:利用通用对抗扰动检测后门攻击
机器学习
2023-08-25 v3
摘要
深度学习模型在众多机器学习任务中取得了优异的性能。然而,它们面临着对抗样本与投毒(后门)攻击等安全相关问题。深度学习模型可能通过在后门数据上训练或修改内部网络参数而被投毒。随后,后门模型在接收干净输入时表现如常,但在接收带有预设计模式(称为“触发器”)的后门输入时则会误分类。遗憾的是,在没有触发器先验知识的情况下,难以区分干净模型与后门模型。本文利用一种特殊类型的对抗攻击——通用对抗扰动(UAP)及其与后门触发器的相似性,提出一种后门检测方法。我们观察到一个直观现象:由后门模型生成的 UAP 比由干净模型生成的 UAP 需要更少的扰动即可误导模型。后门模型的 UAP 倾向于利用由后门触发器构建的从所有类别到目标类别的捷径。我们提出了一种称为通用士兵后门检测(USB)的新方法,并通过 UAP 逆向工程潜在的后门触发器。在多个数据集上训练的 345 个模型的实验表明,USB 能有效检测注入的后门,并提供与最先进方法相当或更好的结果。
引用
@article{arxiv.2302.00747,
title = {Universal Soldier: Using Universal Adversarial Perturbations for Detecting Backdoor Attacks},
author = {Xiaoyun Xu and Oguzhan Ersoy and Stjepan Picek},
journal= {arXiv preprint arXiv:2302.00747},
year = {2023}
}