中文

ArcGen: 跨多样架构泛化的神经网络后门检测

机器学习 2025-12-24 v1 密码学与安全

摘要

后门攻击对深度学习模型的安全性和可靠性构成了重大威胁。为了缓解此类攻击,一种有前景的方法是学习从目标模型中提取特征,并利用这些特征进行后门检测。然而,我们发现现有的基于学习的神经后门检测方法无法很好地泛化到学习阶段未见过的全新架构。在本文中,我们分析了这一问题的根本原因,并提出了一种新颖的黑盒神经后门检测方法,称为ArcGen。我们的方法旨在获取架构不变模型特征,即对齐后的特征,以实现有效的后门检测。具体来说,与现有直接使用模型输出作为模型特征的方法不同,我们在特征提取函数中引入了一个额外的对齐层来进一步处理这些特征。这减少了架构信息对特征的直接影响。然后,我们设计了两种对齐损失来训练特征提取函数。这些损失明确要求来自具有相似后门行为但不同架构的模型的特征在分布和样本层面均对齐。借助这些技术,我们的方法在未见过的模型架构上,检测性能(例如AUC)提升了高达42.5%。这是基于一项大规模评估得出的,该评估涉及在多样化数据集上训练、遭受各种后门攻击并使用不同模型架构的16,896个模型。我们的代码可在https://github.com/SeRAlab/ArcGen获取。

关键词

引用

@article{arxiv.2512.19730,
  title  = {ArcGen: Generalizing Neural Backdoor Detection Across Diverse Architectures},
  author = {Zhonghao Yang and Cheng Luo and Daojing He and Yiming Li and Yu Li},
  journal= {arXiv preprint arXiv:2512.19730},
  year   = {2025}
}

备注

16 pages, 8 figures. This article was accepted by IEEE Transactions on Information Forensics and Security. DOI: 10.1109/TIFS.2025.3610254