双重视觉防御:用于提高视觉语言模型鲁棒性的对抗预训练与指令调优
计算机视觉与模式识别
2025-04-09 v2
摘要
本文探讨了视觉语言模型针对对抗性视觉扰动的鲁棒性,并引入了一种新型的“双重视觉防御”以增强此类鲁棒性。不同于以往针对预训练CLIP模型进行轻量级对抗微调的方法,本文使用 web 规模数据从头进行大规模对抗视觉语言预训练。随后,通过 incorporating 对抗视觉指令调优来加强防御。来自各阶段得到的模型,分别为 CLIP 和 LLaVA,显示出显著增强的零样题鲁棒性,并在视觉语言模型的对抗防御方面达到新的最佳成绩。例如,CLIP 在 ImageNet-1k 上的对抗鲁棒性超过了前所未有的模型约20%。%例如,CLIP 在 ImageNet-1k 上的性能超过了前所未有的模型约20%。同样地,与先前的方法相比,LLaVA 在图像字幕任务上带来约30%的鲁棒性提升,在视觉问答任务上带来约20%的鲁棒性提升。此外,我们的模型表现出更强的零样识别能力、更少的幻觉以及更优的推理性能。我们的项目页面为 https://doublevisualdefense.github.io/。
引用
@article{arxiv.2501.09446,
title = {Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness},
author = {Zeyu Wang and Cihang Xie and Brian Bartoldson and Bhavya Kailkhura},
journal= {arXiv preprint arXiv:2501.09446},
year = {2025}
}