中文

变体中的恶魔:面向鲁棒后门污染检测的DNN统计分析

密码学与安全 2020-12-11 v2

摘要

深度神经网络(DNN)面临的一个安全威胁是后门污染,即攻击者污染目标模型的训练数据以注入木马,使得携带特定触发器的图像总是被分类到特定标签。先前对此问题的研究假设触发器在图像表示中占主导地位,这导致任何带有该触发器的图像都被识别为目标类别的成员。这种触发器在表示空间中也表现出独特的特征,因此可以轻易地与合法图像区分开来。然而,我们的研究表明,简单的目标污染可以使攻击图像的表示与合法图像的表示更难以区分,从而规避现有的后门感染防御措施。在我们的研究中,我们表明这种污染攻击实际上微妙地改变了目标类别的表示分布,这可以通过统计分析来捕获。更具体地说,我们利用EM算法将图像分解为其身份部分(例如,人、交通标志)和类内变化部分(例如,光照、姿态)。然后,我们分析每个类别中的分布,识别出那些更可能由混合模型表征的类别,该混合模型是由于向合法图像池中添加攻击样本而产生的。我们的研究表明,这项新技术能够有效检测数据污染攻击,包括我们提出的新型攻击,并且对于知识渊博的对手的规避尝试也具有鲁棒性。

关键词

引用

@article{arxiv.1908.00686,
  title  = {Demon in the Variant: Statistical Analysis of DNNs for Robust Backdoor Contamination Detection},
  author = {Di Tang and XiaoFeng Wang and Haixu Tang and Kehuan Zhang},
  journal= {arXiv preprint arXiv:1908.00686},
  year   = {2020}
}