中文

基于热图聚类的深度神经网络后门投毒攻击检测

机器学习 2022-04-28 v1 密码学与安全

摘要

神经网络做出的预测可能被所谓的投毒攻击欺诈性地篡改,其中一种特殊情况是后门投毒攻击。我们研究了合适的检测方法,并提出了一种名为热图聚类的新方法。在该方法中,我们对由最先进的可解释人工智能方法——逐层相关性传播生成的热图应用 kk-均值聚类算法,目标是将数据集中的被投毒数据与未被投毒数据分离开。我们将此方法与一种类似方法——激活聚类进行比较,后者同样使用 kk-均值聚类,但以神经网络某些隐藏层的激活作为输入。我们测试了两种方法在标准后门投毒攻击、标签一致投毒攻击以及使用降低幅度贴纸的标签一致投毒攻击下的性能。结果表明,热图聚类的表现始终优于激活聚类。然而,在考虑标签一致投毒攻击时,后一种方法也能获得良好的检测性能。

关键词

引用

@article{arxiv.2204.12848,
  title  = {Detecting Backdoor Poisoning Attacks on Deep Neural Networks by Heatmap Clustering},
  author = {Lukas Schulth and Christian Berghoff and Matthias Neu},
  journal= {arXiv preprint arXiv:2204.12848},
  year   = {2022}
}