中文

Sim-CLIP:基于无监督对称性对抗微调的鲁棒性和语义丰富的视觉语言模型

计算机视觉与模式识别 2026-04-08 v3 人工智能 计算与语言 机器学习

摘要

视觉语言模型(VLMs)高度依赖预训练的视觉编码器来支持图像描述、视觉问答和零样本分类等下游任务。尽管这些编码器表现出色,但它们仍高度脆弱,对难以察觉的对抗扰动极其敏感,这会严重损害多模态推理中的鲁棒性和语义质量。本文引入 Sim-CLIP,一个无监督对抗微调框架,旨在增强 CLIP 视觉编码器的鲁棒性,同时保持整体语义表示。Sim-CLIP 采用对称训练架构,采用余弦相似度目标和对称停止梯度机制,以实现干净视图和对抗视图之间的语义对齐。该设计避免了大批量对比学习和额外的动量编码器,使其能够以较低的计算开销实现鲁棒训练。我们在多个视觉语言模型和任务上评估了 Sim-CLIP,分别针对有针对性和无针对性的对抗攻击。实验结果表明,Sim-CLIP 在鲁棒的 CLIP 变体中始终表现出色,实现了更强的对抗鲁棒性,同时保持或提升了语义保真度。这些发现凸显了现有对抗防御的局限性,并将 Sim-CLIP 确立为鲁棒视觉语言表征学习中有效且可扩展的解决方案。

关键词

引用

@article{arxiv.2407.14971,
  title  = {Sim-CLIP: Unsupervised Siamese Adversarial Fine-Tuning for Robust and Semantically-Rich Vision-Language Models},
  author = {Md Zarif Hossain and Ahmed Imteaj},
  journal= {arXiv preprint arXiv:2407.14971},
  year   = {2026}
}

备注

Accepted at IJCNN 2026