AntidoteRT:神经网络投毒攻击的运行时检测与纠正
密码学与安全
2022-02-03 v1 计算机视觉与模式识别
摘要
我们研究针对图像分类网络的投毒后门攻击,攻击者将触发器插入训练数据的子集,使得在测试时该触发器导致分类器预测某个目标类。我们提出了针对投毒攻击的轻量级自动化检测与纠正技术,其基于使用少量已知标签的干净与投毒测试样本从网络中挖掘的神经元模式。基于误分类样本构建的模式用于运行时检测新的投毒输入。对于纠正,我们提出了一种输入纠正技术,利用差分分析识别所检测投毒图像中的触发器,随后将其重置为中性颜色。我们的检测与纠正是在运行时和输入层级执行的,这与多数聚焦于离线模型层级防御的现有工作形成对比。我们证明,在MNIST、CIFAR-10和GTSRB等流行基准上,针对流行的BadNets攻击和更复杂的DFST攻击,我们的技术优于NeuralCleanse和STRIP等现有防御。
引用
@article{arxiv.2202.01179,
title = {AntidoteRT: Run-time Detection and Correction of Poison Attacks on Neural Networks},
author = {Muhammad Usman and Youcheng Sun and Divya Gopinath and Corina S. Pasareanu},
journal= {arXiv preprint arXiv:2202.01179},
year = {2022}
}