中文

迈向模型参数空间的后门隐蔽性

密码学与安全 2025-12-15 v3 人工智能

摘要

最近关于后门隐蔽性的研究主要集中在输入空间中不可区分的触发器和特征空间中不可分离的后门表示,旨在规避检查这些空间的防御。然而,现有的后门攻击通常设计为抵抗特定类型的后门防御,而没有考虑多样化的防御机制。基于这一观察,我们提出一个自然的问题:当前的后门攻击在面对各种实际防御时是否真正构成现实威胁?为了回答这个问题,我们检查了12种常见的专注于输入空间或特征空间隐蔽性的后门攻击,以及17种多样化的代表性防御。令人惊讶的是,我们揭示了一个关键盲点:设计为在输入和特征空间中隐蔽的后门攻击可以通过在参数空间中检查后门模型来缓解。为了研究这种常见漏洞背后的根本原因,我们研究了后门攻击在参数空间中的特征。值得注意的是,我们发现输入和特征空间攻击会在参数空间中引入显著的后门相关神经元,而当前的后门攻击并未充分考虑这一点。考虑到全面的隐蔽性,我们提出了一种新颖的供应链攻击,称为Grond。Grond通过一个简单而有效的模块——对抗性后门注入(ABI)来限制参数变化,该模块在后门注入过程中自适应地增加参数空间的隐蔽性。大量实验表明,在CIFAR-10、GTSRB和ImageNet子集上,Grond在对抗最先进的(包括自适应)防御时优于所有12种后门攻击。此外,我们表明ABI持续提高了常见后门攻击的有效性。

关键词

引用

@article{arxiv.2501.05928,
  title  = {Towards Backdoor Stealthiness in Model Parameter Space},
  author = {Xiaoyun Xu and Zhuoran Liu and Stefanos Koffas and Stjepan Picek},
  journal= {arXiv preprint arXiv:2501.05928},
  year   = {2025}
}

备注

accepted by CCS 2025