中文

基于稀疏自编码器的对抗攻击检测:视觉语言模型的即插即用防火墙

计算机视觉与模式识别 2026-05-11 v1 人工智能 计算与语言 机器学习

摘要

视觉语言模型 (VLM) 取得了快速进展并在 agent 系统中日益广泛部署,但其安全性获得了相对有限的关注。即使是最新的专有和开源 VLM 仍高度易受对抗攻击,使下游应用暴露于重大风险。本文提出一种基于稀疏自编码器 (SAE) 的新型轻量级对抗攻击检测框架,称为 SAEgis。通过将 SAE 模块插入预训练 VLM 并以标准重建目标进行训练,我们发现所学稀疏潜在特征自然捕获攻击相关信号。这些特征即使针对以前未见过的样本也能可靠分类图像是否被 adversarial 扰动。广泛实验表明,SAEgis 在 in-domain、cross-domain 和 cross-attack 设置下均表现出强大性能,尤其在 cross-domain 泛化方面相较于现有基线实现了显著性改进。此外,多层信号组合进一步提高了鲁棒性和稳定性。鉴于本文是首次探索 SAE 作为 VLMs 对抗攻击检测的即插即用机制,我们的方法无需额外对抗训练,开销最小,为提高实际 VLM 系统的安全性提供了实用方法。

关键词

引用

@article{arxiv.2605.07447,
  title  = {Sparse Autoencoders as Plug-and-Play Firewalls for Adversarial Attack Detection in VLMs},
  author = {Hao Wang and Yiqun Sun and Pengfei Wei and Lawrence B. Hsieh and Daisuke Kawahara},
  journal= {arXiv preprint arXiv:2605.07447},
  year   = {2026}
}