中文

基于检测与修复的测试时后门防御

密码学与安全 2023-11-30 v2

摘要

深度神经网络在许多关键领域(如自动驾驶、人脸识别和医疗诊断)中发挥着至关重要的作用。然而,深度神经网络正面临来自后门攻击的安全威胁,可能被后门攻击者操纵以执行其预定的行为。为了防御后门,先前的研究集中于在模型部署前使用干净数据去除后门攻击。在本文中,我们探讨了利用部分中毒数据在测试时防御后门攻击、从模型中移除后门的可能性。针对该问题,我们提出了一种两阶段方法——测试时后门防御(Test-Time Backdoor Defense, TTBD)。在第一阶段,我们提出一种后门样本检测方法 DDP,用于从一批混合的、部分中毒的样本中识别中毒样本。一旦检测到中毒样本,我们采用 Shapley 估计来计算网络中每个神经元显著性的贡献,定位中毒神经元,并对其进行剪枝以移除模型中的后门。我们的实验表明,TTBD 仅使用一批部分中毒数据,就能在不同模型架构和数据集上针对不同类型的后门攻击成功移除后门。

关键词

引用

@article{arxiv.2308.06107,
  title  = {Test-Time Backdoor Defense via Detecting and Repairing},
  author = {Jiyang Guan and Jian Liang and Ran He},
  journal= {arXiv preprint arXiv:2308.06107},
  year   = {2023}
}