BeniFul: 基于中间特征分析的深度神经网络后门防御
密码学与安全
2025-03-04 v1 机器学习
摘要
后门防御最近在抵抗深度神经网络(DNN)中的后门攻击方面发挥着重要作用,攻击者通过向训练数据集中注入后门样本来在DNN模型中植入后门。虽然有许多实现DNN输入后门检测和DNN模型后门消除的方法,但它们仍未对这两个任务之间的关系提供清晰的解释。在本文中,我们使用DNN模型中间层的特征来分析后门样本与良性样本之间的差异,并提出了后门一致性概念,即如果在输入上检测到后门触发器,表明该DNN模型中至少存在一个后门。通过分析中间特征,我们设计了一种有效且全面的后门防御方法,称为BeniFul,该方法由两个部分组成:一个灰箱后门输入检测和一个白箱后门消除。具体而言,我们使用变分自编码器的重建距离和模型推理结果来实现后门输入检测,并使用特征距离损失来实现后门消除。在CIFAR-10和Tiny ImageNet上的实验结果表明,BeniFul在后门输入检测和后门消除方面表现出卓越的防御能力。
引用
@article{arxiv.2410.14723,
title = {BeniFul: Backdoor Defense via Middle Feature Analysis for Deep Neural Networks},
author = {Xinfu Li and Junying Zhang and Xindi Ma},
journal= {arXiv preprint arXiv:2410.14723},
year = {2025}
}