DHBE:基于受限对抗蒸馏的深度神经网络无数据整体后门擦除
机器学习
2023-06-16 v1 人工智能
密码学与安全
摘要
后门攻击已成为深度神经网络(DNNs)的紧迫威胁,受害 DNN 被秘密植入可由攻击者触发的恶意神经元。为防御后门攻击,许多工作建立了分阶段流水线以从受害 DNN 中移除后门:检测、定位与擦除。然而,在仅有少量干净数据可用的场景下,此类流水线十分脆弱,且无法在不牺牲模型精度的前提下彻底擦除后门。为解决该问题,本文提出一种新颖的无数据整体后门擦除(DHBE)框架。DHBE 未采用分阶段流水线,而是将后门擦除任务视为统一的对抗过程,寻求两个不同竞争过程之间的均衡:蒸馏与后门正则化。在蒸馏中,后门 DNN 被蒸馏为代理模型,迁移其关于干净数据的知识,但后门同时也被迁移。在后门正则化中,代理模型被整体正则化以防止感染任何可能从蒸馏中迁移来的后门。这两个过程以无数据对抗优化方式联合推进,直至获得干净且高精度的代理模型。凭借新颖的对抗设计,我们的框架在三个方面展现出优势:1)对模型精度损害极小,2)对超参数容忍度高,3)无需干净数据。我们在多种后门攻击与数据集上进行了充分实验以验证所提框架的有效性。代码见 \url{https://github.com/yanzhicong/DHBE}
引用
@article{arxiv.2306.08009,
title = {DHBE: Data-free Holistic Backdoor Erasing in Deep Neural Networks via Restricted Adversarial Distillation},
author = {Zhicong Yan and Shenghong Li and Ruijie Zhao and Yuan Tian and Yuanyuan Zhao},
journal= {arXiv preprint arXiv:2306.08009},
year = {2023}
}
备注
It has been accepted by asiaccs