中文

3S-攻击:一种针对 DNN 模型的时空、谱、语义不可见后门攻击

密码学与安全 2025-12-10 v2

摘要

后门攻击通过中毒训练数据或修改模型本身来植入隐藏行为。这些攻击旨在保持良好输入上的高准确率,同时在特定触发器存在时进行误分类。虽然已有研究探索了空间和谱域中的隐形触发器,但很少考虑语义域。在本文中,我们提出了 3S-attack,这是一种在时空、谱、语义三个域上都隐形的后门攻击。关键思想是利用良好样本的语义特征作为触发器,结合梯度加权类激活映射(Grad-CAM)和提取模型。随后在谱域嵌入触发器,并在空间域施加像素级限制。此过程最小化被毒化样本与良好样本之间的距离,使攻击难以被现有防御和人类检查检测。它暴露了鲁棒性与语义可解释性交汇处的漏洞,表明模型可被操纵以实现语义一致但恶意的方式。广泛的实验和理论分析均显示 3S-attack 的隐形性,并凸显了确保 AI 安全的需求。

关键词

引用

@article{arxiv.2507.10733,
  title  = {3S-Attack: Spatial, Spectral and Semantic Invisible Backdoor Attack Against DNN Models},
  author = {Jianyao Yin and Luca Arnaboldi and Honglong Chen and Pascal Berrang and Mark Ryan},
  journal= {arXiv preprint arXiv:2507.10733},
  year   = {2025}
}

备注

20 pages, 12 figures