剥离与恶意注入:面向 Transformer 模型的无需重新训练的后门攻击
机器学习
2025-08-15 v1
摘要
Transformer 模型在计算机视觉(CV)和自然语言处理(NLP)任务中展现出卓越的性能,已成为不可或缺的技术。然而,近期研究表明 Transformer 模型容易受到后门攻击。以往的后门攻击方法通常依赖干净数据重新训练或改变模型架构,这两种方法都可能非常资源密集且具有侵入性。本文提出了 Head-wise Pruning and Malicious Injection(HPMI),这是一种针对 Transformer 模型的、无需重新训练的新型后门攻击,不会改变模型的架构。该方法仅需原始数据的子集,以及对模型架构的基本知识,无需对目标 Transformer 进行重新训练。技术上,HPMI 通过剥离最不重要的 head 并注入预训练的恶意 head 来建立后门。我们提供了严格的理论依据,表明在合理假设下,植入的后门能够抵抗最新防御技术的检测与移除。实验评估在多个数据集上进一步验证了 HPMI 的有效性,显示它 1) 几乎不影响干净准确率损失,2) 实现至少 99.55% 的攻击成功率,3) 能够规避四种高级防御机制。此外,与基于重新训练的先进攻击方法相比,HPMI 在隐蔽性和对抗多样化防御策略的鲁棒性方面具有优势,同时保持对干净准确率的最小影响。
引用
@article{arxiv.2508.10243,
title = {Pruning and Malicious Injection: A Retraining-Free Backdoor Attack on Transformer Models},
author = {Taibiao Zhao and Mingxuan Sun and Hao Wang and Xiaobing Chen and Xiangwei Zhou},
journal= {arXiv preprint arXiv:2508.10243},
year = {2025}
}