3S-攻击:一种针对 DNN 模型的时空、谱、语义不可见后门攻击
密码学与安全
2025-12-10 v2
摘要
后门攻击通过中毒训练数据或修改模型本身来植入隐藏行为。这些攻击旨在保持良好输入上的高准确率,同时在特定触发器存在时进行误分类。虽然已有研究探索了空间和谱域中的隐形触发器,但很少考虑语义域。在本文中,我们提出了 3S-attack,这是一种在时空、谱、语义三个域上都隐形的后门攻击。关键思想是利用良好样本的语义特征作为触发器,结合梯度加权类激活映射(Grad-CAM)和提取模型。随后在谱域嵌入触发器,并在空间域施加像素级限制。此过程最小化被毒化样本与良好样本之间的距离,使攻击难以被现有防御和人类检查检测。它暴露了鲁棒性与语义可解释性交汇处的漏洞,表明模型可被操纵以实现语义一致但恶意的方式。广泛的实验和理论分析均显示 3S-attack 的隐形性,并凸显了确保 AI 安全的需求。
引用
@article{arxiv.2507.10733,
title = {3S-Attack: Spatial, Spectral and Semantic Invisible Backdoor Attack Against DNN Models},
author = {Jianyao Yin and Luca Arnaboldi and Honglong Chen and Pascal Berrang and Mark Ryan},
journal= {arXiv preprint arXiv:2507.10733},
year = {2025}
}
备注
20 pages, 12 figures