针对深度神经网络的后门攻击及可能防御综述
密码学与安全
2021-11-17 v1 计算机视觉与模式识别
摘要
基于深度神经网络(DNN)的 AI 技术在社会各方面取得令人瞩目的进展的同时,也带来日益增长的安全担忧。尽管测试时攻击最初垄断了研究者的注意力,但后门攻击利用通过干扰训练过程来破坏 DNN 模型的可能性,构成了进一步严重威胁 AI 技术可靠性的隐患。在后门攻击中,攻击者污染训练数据以在测试时诱导错误行为。然而,测试时错误仅在出现对应于精心构造输入样本的触发事件时被激活。如此,被污染的网络对常规输入仍如预期工作,而恶意行为仅当攻击者决定激活隐藏于网络中的后门时才发生。过去几年,后门攻击成为密集研究活动的主题,聚焦于新型攻击类的开发及可能对策的提出。本综述论文旨在回顾迄今发表的工作,对迄今提出的不同类型攻击与防御进行分类。指导分析的分类基于攻击者对训练过程的控制量,以及防御者验证所用训练数据完整性并监控 DNN 在训练与测试时操作的能力。因此,所提分析特别适于凸显攻击与防御在其应用场景下的优势与弱点。
引用
@article{arxiv.2111.08429,
title = {An Overview of Backdoor Attacks Against Deep Neural Networks and Possible Defences},
author = {Wei Guo and Benedetta Tondi and Mauro Barni},
journal= {arXiv preprint arXiv:2111.08429},
year = {2021}
}