EigenShield:基于随机矩阵理论的因果子空间过滤用于对抗鲁棒视觉语言模型
机器学习
2025-02-24 v1 密码学与安全
计算机视觉与模式识别
摘要
视觉语言模型 (VLM) 继承了大型语言模型 (LLM) 的对抗性脆弱性,其多模态特性进一步加剧了这种脆弱性。现有的防御措施,包括对抗训练、输入转换和启发式检测,计算代价高、依赖模型架构且对适应性攻击脆弱。我们提出了 EigenShield,这是一种推理时防御方法,利用随机矩阵理论量化 VLM 高维表示中的对抗性干扰。与依赖经验启发式的先前方法不同,EigenShield 采用 spike 协方差模型来检测结构化谱偏差。通过 Robustness-based Nonconformity Score (RbNS) 和分位数阈值化,它分离出编码语义信息的因果特征向量与易受对抗性工伤影响的相关特征向量。通过将嵌入投影到因果子空间,EigenShield 在不修改模型参数或需要对抗训练的情况下过滤对抗性噪声。该方法具有架构独立、攻击agnostic 的特性,显著降低了攻击成功率,确立了谱分析作为传统防御的原则方法。我们的结果表明,EigenShield 在所有现有防御措施中均表现出色,包括对抗训练、UNIGUARD 和 CIDER。
引用
@article{arxiv.2502.14976,
title = {EigenShield: Causal Subspace Filtering via Random Matrix Theory for Adversarially Robust Vision-Language Models},
author = {Nastaran Darabi and Devashri Naik and Sina Tayebati and Dinithi Jayasuriya and Ranganath Krishnan and Amit Ranjan Trivedi},
journal= {arXiv preprint arXiv:2502.14976},
year = {2025}
}