通过模块切换防御后门攻击
密码学与安全
2026-04-14 v2 计算与语言
摘要
后门攻击构成对深度神经网络 (DNN) 的严重威胁,使对手能够在推理中植入触发器以实现隐藏行为。防御此类漏洞在 post-training 设置下尤为困难,因为最终用户缺乏训练数据或对攻击的先验知识。模型合并提供了一种成本效益高的防御方法;然而,最新方法如权重平均 (WAG) 在多个同构模型可用时提供相当可靠的防御,但在模型数量较少时效果较差,给防御者造成沉重负担。我们提出了一种模块切换防御 (MSD) 用于破坏后门捷径。我们首先在两层网络上验证了其理论依据和实证有效性,显示其在实现更高的后门发散方面优于 WAG,并且保持实用性。对于深度模型,我们在 Transformer 和 CNN 架构上评估 MSD,并设计一种演化算法来优化融合策略,采用选择性机制以识别最有效的组合。实验表明,MSD 在实际场景下以更少的模型实现更强的防御,即使在模型间存在共谋攻击的情况下——即一些模型共享相同的后门——MSD 的切换策略也能对多样化的攻击提供优越的鲁棒性。代码可在 https://github.com/weijun-l/module-switching-defense 获取。
引用
@article{arxiv.2504.05902,
title = {Defending against Backdoor Attacks via Module Switching},
author = {Weijun Li and Ansh Arora and Xuanli He and Mark Dras and Qiongkai Xu},
journal= {arXiv preprint arXiv:2504.05902},
year = {2026}
}
备注
Accepted to ICLR 2026