HaS-Nets:一种用于防御数据收集场景下DNN后门攻击的修复与选择机制
机器学习
2020-12-15 v1 密码学与安全
摘要
我们见证了深度神经网络(DNN)上后门攻击与相应防御策略之间持续的军备竞赛。大多数最先进的防御依赖于对“输入”或“潜在DNN表示”的统计净化以捕获木马行为。本文中,我们首先通过引入一种称为“低置信度后门攻击”的新型定向后门攻击变体,挑战此类近期报道防御的鲁棒性。我们还提出了一种称为“HaS-Nets”的新型防御技术。“低置信度后门攻击”利用分配给中毒训练样本的置信度标签,通过赋予低值以在训练和推理期间向防御者隐藏其存在。我们针对四种最先进的防御方法(即STRIP、Gradient-Shaping、Februus和ULP-defense)评估该攻击,分别达到99%、63.73%、91.2%和80%的攻击成功率(ASR)。我们随后提出“HaS-Nets”,以在训练期间使用约占总训练数据2%至15%的合理小规模修复数据集,在每次迭代时修复网络,从而抵抗后门植入。我们在不同数据集(Fashion-MNIST、CIFAR-10、Consumer Complaint和Urban Sound)与网络架构(MLP、2D-CNN、1D-CNN)上对其评估。实验表明,“HaS-Nets”能将ASR从超过90%降至低于15%,且与数据集、攻击配置和网络架构无关。
引用
@article{arxiv.2012.07474,
title = {HaS-Nets: A Heal and Select Mechanism to Defend DNNs Against Backdoor Attacks for Data Collection Scenarios},
author = {Hassan Ali and Surya Nepal and Salil S. Kanhere and Sanjay Jha},
journal= {arXiv preprint arXiv:2012.07474},
year = {2020}
}
备注
21 pages, 36 figures, conference paper