自校准一致性可抵御针对视觉语言模型的对抗鲁棒性
计算机视觉与模式识别
2025-10-28 v1
摘要
预训练视觉语言模型 (VLM) 如 CLIP 在各类领域中展现出强大的零样学习能力,但仍高度脆弱面对破坏图像-文本对齐并损害可靠性的对抗扰动。现有防御措施通常依赖带标签数据的对抗微调,限制了其在零样学习情景中的适用性。在本工作中,我们识别出当前 CLIP 对抗攻击的两个关键弱点——缺乏语义指导和对视角变化的脆弱性——统称为语义和视角脆弱性。为解决这些挑战,我们提出了一种有效的测试时防御方法,即自校准一致性 (Self-Calibrated Consistency, SCC)。SCC 由两个互补模块组成:语义一致性,通过对抗热身和多视角预测的软伪标签来正则化跨模态对齐,并将目标嵌入与易混淆的负样本分离;空间一致性,通过增强视图对扰动后的视觉预测进行对齐,以稳定对抗扰动下的推理。这些模块共同构成一个即插即用的数据推理策略。广泛的在 22 个基准测试上的实验表明,SCC 在各种攻击设置下均能显著提升 CLIP 的零样学习鲁棒性,同时保持准确率,且可以无缝集成到其他 VLM 中以获得进一步的提升。这些发现凸显了从 CLIP 建立对抗鲁棒范式的巨大潜力,对更广泛的视觉语言领域(如 BioMedCLIP)具有深远意义。
引用
@article{arxiv.2510.22785,
title = {Self-Calibrated Consistency can Fight Back for Adversarial Robustness in Vision-Language Models},
author = {Jiaxiang Liu and Jiawei Du and Xiao Liu and Prayag Tiwari and Mingkun Xu},
journal= {arXiv preprint arXiv:2510.22785},
year = {2025}
}