XSPA:用于VLMs可迁移攻击的不可感知X形稀疏对抗扰动
计算机视觉与模式识别
2026-03-31 v1
摘要
视觉语言模型(VLMs)依赖于共享的视觉-文本表示空间以执行零样分类、图像描述和视觉问答(VQA)等任务。虽然这种共享空间实现了强大的跨任务泛化,但也可能引入常见漏洞:小规模视觉扰动可通过共享嵌入空间并导致跨任务的关联语义失效。这种风险在交互式和决策支持场景中尤为重要,但目前尚不清楚VLMs对高度受限、稀疏且具有固定几何先验的扰动鲁棒性如何。为回答此问题,我们提出了X形稀疏像素攻击(XSPA),这是一种不可感知的结构化攻击,将扰动限制在两个相交对角线上。与稠密扰动或灵活的局部区域相比,XSPA受到更严格的攻击预算约束,因此对VLMs鲁棒性提出了更严苛的测试。在这种稀疏支持下,XSPA联合优化分类目标、跨任务语义引导以及扰动幅度和沿线平滑性的正则化,诱导可迁移的误分类,以及在描述和VQA中的语义漂移,同时保持视觉细微性。在默认设置下,XSPA仅修改约1.76%的图像像素。在COCO数据集上的实验表明,XSPA在所有三个任务上均一致降低了性能。OpenAI CLIP ViT-L/14的零样准确率下降52.33分,OpenCLIP ViT-B/16下降67.00分,而GPT-4评估的描述一致性最多下降58.60分,VQA正确性最多下降44.38分。这些结果表明,即便是高度稀疏且视觉细微、具有固定几何先验的扰动,也能显著扰乱VLMs的跨任务语义,揭示了当前多模态系统在鲁棒性方面的显著差距。
引用
@article{arxiv.2603.28568,
title = {XSPA: Crafting Imperceptible X-Shaped Sparse Adversarial Perturbations for Transferable Attacks on VLMs},
author = {Chengyin Hu and Jiaju Han and Xuemeng Sun and Qike Zhang and Yiwei Wei and Ang Li and Chunlei Meng and Xiang Chen and Jiahuan Long},
journal= {arXiv preprint arXiv:2603.28568},
year = {2026}
}