中文

高质量文本,鲁棒视觉:语言在增强视觉-语言模型视觉鲁棒性中的作用

计算机视觉与模式识别 2025-07-23 v1

摘要

保护预训练视觉-语言模型(VLM),如 CLIP,免受对抗攻击至关重要,因为这些模型被广泛用于包括图像分类在内的多种零样本任务中。然而,现有的用于鲁棒微调的对抗训练(AT)方法在很大程度上忽略了语言在增强视觉鲁棒性中的作用。具体而言,(1)有监督 AT 依赖短文本(如类别标签)生成对抗扰动,导致对训练数据中物体类别的过拟合;(2)无监督 AT 避免了这种过拟合,但由于缺乏语义指导,在应对实际的文本引导对抗攻击时仍然次优。为了解决这些局限性,我们提出了高质量文本引导的对抗微调(QT-AFT),它在训练期间利用高质量描述来引导对抗样本远离图像中存在的多样语义。这使得视觉编码器即使在对抗噪声下也能鲁棒地识别更广泛的图像特征,从而增强在各种下游任务中的鲁棒性。QT-AFT 克服了先前方法的关键弱点——有监督 AT 中的过拟合和无监督 AT 中缺乏语义感知——在 16 个零样本数据集上实现了最先进的零样本对抗鲁棒性和干净准确率。此外,我们的综合研究揭示了语言在增强视觉鲁棒性方面的几个关键洞察;例如,除了物体名称外描述物体属性可进一步增强零样本鲁棒性。我们的发现指出了未来工作的一个紧迫方向——在鲁棒视觉表示学习中以高质量语言监督为中心。

关键词

引用

@article{arxiv.2507.16257,
  title  = {Quality Text, Robust Vision: The Role of Language in Enhancing Visual Robustness of Vision-Language Models},
  author = {Futa Waseda and Saku Sugawara and Isao Echizen},
  journal= {arXiv preprint arXiv:2507.16257},
  year   = {2025}
}

备注

ACMMM 2025 Accepted