通过对抗性微调强大的视觉语言模型编码器以抵御越狱与对抗攻击
计算机视觉与模式识别
2024-09-12 v1 人工智能
摘要
大型视觉语言模型 (LVLMs) 训练于多模态大型数据集,已显著推动了 AI 进展,在视觉语言任务中表现出色。然而,这些模型仍然容易受到对抗性攻击,特别是越狱攻击,这些攻击会绕过安全协议,导致模型生成误导或有害响应。这一脆弱性源于 LLM 本身的固有脆弱性以及视觉模态引入的扩大攻击面。我们提出 Sim-CLIP+,一种新的防御机制,通过对抗性微调 CLIP 视觉编码器,利用 siamese 架构实现。这一方法最大化扰动样本与干净样本之间的余弦相似性,促进对抗性操纵的韧性。Sim-CLIP+ 提供即插即用解决方案,允许无缝集成到现有的 LVLM 架构中作为强大的视觉编码器。与以前的防御方法不同,本方法不需要对 LVLM 进行结构修改,计算开销最小。Sim-CLIP+ 在针对梯度基础对抗攻击和各种越狱技术的防御方面表现有效。我们针对三种不同的越狱攻击策略进行评估,并使用标准下游数据集进行干净评估,包括 COCO 用于图像描述和 OKVQA 用于视觉问答。广泛的实验表明,Sim-CLIP+ 在保持高干净准确率的同时,显著提高了对抗性攻击和越狱技术的韧性。我们的代码和强大的视觉编码器已在 https://github.com/speedlab-git/Robust-Encoder-against-Jailbreak-attack.git 上提供。
引用
@article{arxiv.2409.07353,
title = {Securing Vision-Language Models with a Robust Encoder Against Jailbreak and Adversarial Attacks},
author = {Md Zarif Hossain and Ahmed Imteaj},
journal= {arXiv preprint arXiv:2409.07353},
year = {2024}
}