通过前提变换缓解后门攻击
密码学与安全
2023-06-06 v1 计算机视觉与模式识别
摘要
近年来,随着深度神经网络(DNN)在NLP、CV等领域的成功应用,其安全性也受到广泛关注。(作者)在Badnet中提出了后门攻击方法,通过污染训练样本将后门植入模型。带后门的模型在正常验证样本集上不表现任何异常,但在带触发器的输入中,它们被误分类为攻击者指定类别或与真实标签不同的随机类别。该攻击方法严重威胁DNN在自动驾驶、目标检测等现实生活中的正常应用。本文提出一种对抗后门攻击的新方法。我们将触发器覆盖区域中的特征称为触发器特征,其余区域称为正常特征。通过在训练过程中引入前提计算条件,这些条件对正常特征和触发器特征影响很小,并可完成标准后门模型的训练。在这些前提计算条件下训练的模型,在具有相同前提计算条件的验证集D'val上,性能与普通后门模型一致;而在无前提计算条件的验证集Dval上,验证精度仅下降极少(7%~12%),而攻击成功率(ASR)从90%降至约8%。作者称此方法为前提变换(PT)。
引用
@article{arxiv.2306.01983,
title = {Mitigating Backdoor Attack Via Prerequisite Transformation},
author = {Han Gao},
journal= {arXiv preprint arXiv:2306.01983},
year = {2023}
}
备注
7 pages,7 figures,2 tables