UNIT:通过自动化神经网络分布紧致化实现后置后门缓解
密码学与安全
2024-07-17 v1 计算机视觉与模式识别
摘要
深度神经网络(DNN)在各个领域展现出良好的性能。然而,DNN对后门攻击十分脆弱,这类攻击会向输入注入独特的模式(称为触发器),以导致模型将输入误分类为攻击者指定的目标标签。虽然已有工作提出了各种方法来缓解受毒化模型中的后门效应,但这些方法往往在应对最新进阶攻击时效果有限。本文引入一种新型后置训练防御技术UNIT,可有效消除各种攻击的后门效应。具体而言,UNIT approximates 每个神经元的唯一紧致激活分布,然后主动驱散超出该分布边界的显著较大的激活值。我们的实验结果表明,UNIT 在针对 14 种现有后门攻击(包括 2 种进阶攻击)时,优于 7 种流行防御方法,且仅需 5% 的干净训练数据。UNIT 还具有较高的计算效率。代码已公开于 https://github.com/Megum1/UNIT。
引用
@article{arxiv.2407.11372,
title = {UNIT: Backdoor Mitigation via Automated Neural Distribution Tightening},
author = {Siyuan Cheng and Guangyu Shen and Kaiyuan Zhang and Guanhong Tao and Shengwei An and Hanxi Guo and Shiqing Ma and Xiangyu Zhang},
journal= {arXiv preprint arXiv:2407.11372},
year = {2024}
}
备注
The 18th European Conference on Computer Vision ECCV 2024