BadVim: 揭示视觉状态空间模型中的后门威胁
计算机视觉与模式识别
2025-11-18 v3
摘要
视觉状态空间模型 (Visual State Space Model, VSSM) 在计算机视觉任务中展现出卓越的性能。然而,后门攻击构成了重大的安全挑战,导致受感染的模型在特定触发器存在时预测目标标签,而在正常样本上保持常规行为。本文我们考察了 VSSM 免受后门攻击的鲁棒性。具体而言,我们精心设计了一种名为 BadVim 的新型 VSSM 框架,该框架利用状态层面的低秩扰动来揭示其在训练期间对状态转移的影响。仅通过污染 0.3% 的训练数据,我们的攻击即可在推理时以超过 97% 的高攻击成功率将任何嵌有触发器的输入误分类为目标类。我们的发现表明,VSSM 的状态空间表示属性——这有助于提升模型性能——也可能促成其对后门攻击的脆弱性。我们的攻击在三个数据集上均表现有效,甚至能突破当前针对此类攻击的先进防御。大量实验表明,VSSM 的后门鲁棒性相当于 Transformer (ViT) 且优于卷积神经网络 (CNN)。我们认为本研究 findings 将促使社区重新考虑模型设计中性能与鲁棒性之间的权衡。
引用
@article{arxiv.2408.11679,
title = {BadVim: Unveiling Backdoor Threats in Visual State Space Model},
author = {Cheng-Yi Lee and Yu-Hsuan Chiang and Zhong-You Wu and Chia-Mu Yu and Chun-Shien Lu},
journal= {arXiv preprint arXiv:2408.11679},
year = {2025}
}
备注
Accepted by ECAI 2025