中文

Robust CLIP:面向鲁棒大型视觉 - 语言模型的视觉嵌入无监督对抗微调

机器学习 2024-06-06 v2 人工智能 计算机视觉与模式识别 机器学习

摘要

OpenFlamingo、LLaVA 和 GPT-4 等多模态基础模型正日益被用于各种现实世界任务。先前的工作表明,这些模型极易受到针对视觉模态的对抗攻击。这些攻击可被利用来传播虚假信息或欺诈用户,从而构成重大风险,这使得大型多模态基础模型的鲁棒性成为一个紧迫问题。CLIP 模型或其变体之一被用作许多大型视觉 - 语言模型(LVLMs)(如 LLaVA 和 OpenFlamingo)中的冻结视觉编码器。我们提出了一种无监督对抗微调方案,以获得鲁棒的 CLIP 视觉编码器,从而使所有依赖 CLIP 的视觉下游任务(LVLMs、零样本分类)均具备鲁棒性。特别是,我们表明,一旦用我们的鲁棒模型替换原始 CLIP 模型,恶意第三方通过提供操纵图像对 LVLM 用户进行的隐蔽攻击将不再可能。无需对下游 LVLMs 进行重新训练或微调。代码和鲁棒模型可在 https://github.com/chs20/RobustVLM 获取。

关键词

引用

@article{arxiv.2402.12336,
  title  = {Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models},
  author = {Christian Schlarmann and Naman Deep Singh and Francesco Croce and Matthias Hein},
  journal= {arXiv preprint arXiv:2402.12336},
  year   = {2024}
}

备注

ICML 2024 Oral