中文

什么使得视觉语言模型(VLMs)具有鲁棒性?关于鲁棒性与准确性平衡的探讨

计算机视觉与模式识别 2026-05-06 v2

摘要

在视觉语言模型(VLMs)中实现对抗鲁棒性不可避免地会牺牲干净数据上的准确性,这是一种长期且具有挑战性的权衡问题。本文通过研究一个根本性问题——什么使得VLMs具有鲁棒性——来重新审视这一权衡。我们对经过对抗微调的模型进行详细分析,考察鲁棒性机制如何在内部发挥作用,以及它们如何与干净准确性相互作用。我们的分析揭示,对抗鲁棒性并非在网络深度上均匀分布。意外地,它主要局限于浅层,由低频谱偏差和对输入不敏感的注意力模式驱动。而对深层的更新则倾向于削弱干净准确性和鲁棒性。基于这些见解,我们提出了对抗鲁棒性适应(Adversarial Robustness Adaptation, R-Adapt),这是一个简单而有效的框架,冻结所有预训练权重,仅在初始层引入最小且具有洞察力的适应。这一设计实现了对抗鲁棒性与干净准确性的卓越平衡。R-Adapt进一步支持训练-free、模型导向和数据驱动的范式,提供了灵活的路径,以无缝地为标准模型增添鲁棒性。在18个数据集和多样化任务上的广泛评估表明,我们在各种攻击下的性能均达到最新水平。值得注意的是,R-Adapt能够高效地推广到大型视觉语言模型(如LLaVA和Qwen-VL),增强其鲁棒性。我们的项目页面可在https://summu77.github.io/R-Adapt/上访问。

关键词

引用

@article{arxiv.2603.12799,
  title  = {What Makes VLMs Robust? Towards Reconciling Robustness and Accuracy in Vision-Language Models},
  author = {Sen Nie and Jie Zhang and Zhongqi Wang and Zhaoyang Wei and Shiguang Shan and Xilin Chen},
  journal= {arXiv preprint arXiv:2603.12799},
  year   = {2026}
}

备注

Preliminary analyses should be evaluated under strictly adaptive attacks; some conclusions require further validation