NNoculation:在真实场景中捕获 BadNet 后门神经网络
密码学与安全
2021-11-16 v2 机器学习
摘要
本文提出了一种针对后门神经网络(BadNets)的新型两阶段防御方法(NNoculation),该方法在部署前和在线阶段均能修复 BadNet,以应对在实际环境中遇到的后门测试输入。在部署前阶段,NNoculation 使用干净验证输入的随机扰动对 BadNet 进行再训练,以部分降低后门的对抗性影响。部署后,NNoculation 通过记录原始网络与部署前修补网络之间的分歧来检测并隔离后门测试输入。随后训练一个 CycleGAN 来学习干净验证输入与隔离输入之间的变换;即,它学习向干净验证图像添加触发器。后门验证图像及其正确标签被用于进一步再训练部署前修补网络,从而得到我们的最终防御。在一套全面的后门攻击上的实证评估表明,NNoculation 优于所有最先进的防御方法,后者要么做出限制性假设且只适用于特定后门攻击,要么在自适应攻击下失效。相比之下,NNoculation 做出的假设最少,并提供有效的防御,即使在现有防御因攻击者规避其限制性假设而失效的设置下也是如此。
引用
@article{arxiv.2002.08313,
title = {NNoculation: Catching BadNets in the Wild},
author = {Akshaj Kumar Veldanda and Kang Liu and Benjamin Tan and Prashanth Krishnamurthy and Farshad Khorrami and Ramesh Karri and Brendan Dolan-Gavitt and Siddharth Garg},
journal= {arXiv preprint arXiv:2002.08313},
year = {2021}
}