MirrorCheck: 视觉-语言模型的高效对抗防御
计算机视觉与模式识别
2026-05-26 v4 人工智能
机器学习
摘要
视觉-语言模型(VLM)越来越容易受到复杂的对抗攻击, 包括专门为绕过现有防御而设计的自适应策略。为了解决这一漏洞, 我们提出了 MirrorCheck, 一个鲁棒且模型无关的检测框架, 在单模态和多模态设置中都能有效运行。MirrorCheck 利用文本到图像(T2I)模型从目标模型生成的标题中重新生成视觉内容, 并通过比较原始图像和合成图像之间的特征空间嵌入来评估语义一致性。为了增强对自适应攻击的鲁棒性, MirrorCheck 引入了一种随机防御策略, 从多样化的模型库中随机选择 T2I 生成器和图像编码器。此外, 我们引入了一种新颖的一次性(OTU)扰动, 应用于所选编码器嵌入, 并由缩放因子调节, 从而降低了自适应攻击的有效性。在多个威胁场景下的大量实验表明, MirrorCheck 始终优于基线方法, 即使在强自适应对抗条件下也能保持其效用。
引用
@article{arxiv.2406.09250,
title = {MirrorCheck: Efficient Adversarial Defense for Vision-Language Models},
author = {Samar Fares and Klea Ziu and Toluwani Aremu and Nikita Durasov and Martin Takáč and Pascal Fua and Ivan Laptev and Karthik Nandakumar},
journal= {arXiv preprint arXiv:2406.09250},
year = {2026}
}