正常训练深度学习模型中的后门漏洞
密码学与安全
2022-11-30 v1 机器学习
摘要
我们对正常训练的深度学习模型中的后门漏洞进行了系统研究。它们与通过数据投毒注入的后门同样危险,因为二者可被同等利用。我们以文献中 20 种不同类型的注入式后门攻击为指导,研究它们在正常训练模型中的对应物,我们称之为自然后门漏洞。我们发现自然后门广泛存在,大多数注入式后门攻击都有自然对应物。我们对这些自然后门进行了分类,并提出了一种通用检测框架。该框架在从互联网下载的 56 个正常训练模型中发现了 315 个自然后门,覆盖所有不同类别,而专为注入式后门设计的现有扫描器最多只能检测到 65 个后门。我们还研究了自然后门的根因与防御。
引用
@article{arxiv.2211.15929,
title = {Backdoor Vulnerabilities in Normally Trained Deep Learning Models},
author = {Guanhong Tao and Zhenting Wang and Siyuan Cheng and Shiqing Ma and Shengwei An and Yingqi Liu and Guangyu Shen and Zhuo Zhang and Yunshu Mao and Xiangyu Zhang},
journal= {arXiv preprint arXiv:2211.15929},
year = {2022}
}