通过中间谱子空间视角看视觉语言模型的对抗脆弱性
机器学习
2026-07-08 v1 人工智能
摘要
深度神经网络(DNN)的对抗脆弱性已从决策边界几何、特征鲁棒性、输入-输出雅可比矩阵以及逆问题的不稳定性等角度进行了研究。在这里,我们关注现代DNN中传播信息的中间线性变换的谱结构,这是一种尚未被探索的对抗脆弱性机制。具体来说,我们研究了基于Transformer的视觉语言模型,其线性层具有可解释的谱分解,并且其广泛采用使得理解其鲁棒性变得越来越重要。我们提出了一种白盒谱子空间引导攻击(SSGRA),它将中间表示与由最小右奇异向量张成的子空间对齐。我们的实验表明,与现有基线相比,攻击有效性有所提高。此外,SSGRA为VLM中的对抗脆弱性提供了一种谱解释,为改进其鲁棒性提供了见解。
引用
@article{arxiv.2607.07375,
title = {On Adversarial Vulnerability of Vision-Language Models through the Lens of Intermediate Spectral Subspaces},
author = {Chethan Krishnamurthy Ramanaik and Tobias Callies and Michael Hecht and Eirini Ntoutsi},
journal= {arXiv preprint arXiv:2607.07375},
year = {2026}
}