中文

仅用少量干净样本通过遗忘与重学习的统一神经后门移除

密码学与安全 2025-06-25 v2 人工智能

摘要

深度神经网络在各种应用中取得了显著成功,然而它们对后门攻击的脆弱性带来了严重的安全风险——尤其是在防御时只有有限干净样本可用的情况下。在这项工作中,我们通过提出ULRL(用于后门移除的遗忘与重学习),一种新颖的两阶段方法,来解决这一关键挑战,以实现全面的后门移除。我们的方法首先采用遗忘阶段,在该阶段中,网络在小型干净数据集上的损失被有意最大化,以暴露对后门触发器过度敏感的神经元。随后,在重学习阶段,这些可疑神经元通过有针对性的重新初始化和余弦相似度正则化进行校准,有效中和后门影响,同时保持模型在良性数据上的性能。在多个数据集(CIFAR-10、CIFAR-100、GTSRB和Tiny-ImageNet)和架构(PreAct-ResNet18、VGG19-BN和ViT-B-16)上针对12种后门类型的大量实验表明,ULRL显著降低了攻击成功率,同时不损害干净准确率——即使仅使用1%的干净数据进行防御。

关键词

引用

@article{arxiv.2405.14781,
  title  = {Unified Neural Backdoor Removal with Only Few Clean Samples through Unlearning and Relearning},
  author = {Nay Myat Min and Long H. Pham and Jun Sun},
  journal= {arXiv preprint arXiv:2405.14781},
  year   = {2025}
}

备注

Accepted for publication in IEEE Transactions on Information Forensics and Security (TIFS), 2025; 15 pages