针对投毒深度神经网络的后门触发器测试时检测
密码学与安全
2021-12-08 v1 机器学习
摘要
后门(特洛伊)攻击是针对深度神经网络(DNN)的新兴威胁。被攻击的 DNN 会在来自任意源类的测试样本嵌入后门模式时将其预测为攻击者指定的目标类;同时仍能正确分类干净(无攻击)的测试样本。现有的后门防御方法已在“训练后”体制下成功检测出 DNN 是否受到攻击并逆向工程出后门模式:防御者可以访问待检测的 DNN 以及独立收集的小型干净数据集,但无法访问该 DNN 的(可能投毒的)训练集。然而,这些防御既不能在触发后门映射的行为发生时捕获罪魁祸首,也不能在测试时缓解后门攻击。在本文中,我们提出了一种针对图像分类后门攻击的“飞行中”防御,该防御 1)在测试时检测后门触发器的使用;以及 2)推断被检测触发器样本的来源类(源类)。我们的防御在不同强后门攻击下的有效性通过实验得到了证明。
引用
@article{arxiv.2112.03350,
title = {Test-Time Detection of Backdoor Triggers for Poisoned Deep Neural Networks},
author = {Xi Li and Zhen Xiang and David J. Miller and George Kesidis},
journal= {arXiv preprint arXiv:2112.03350},
year = {2021}
}