中文

防御基于补丁视觉提示注入的视觉语言模型

计算机视觉与模式识别 2024-08-27 v2 人工智能

摘要

大型语言模型正变得愈发重要,这也预示着多模态性是人工智能下一个前沿,同时人们正利用其嵌入来生成文本内容。视觉语言模型(VLM)处于这一进步的前沿,为结合视觉和文本数据以实现更深入的理解和交互提供了创新方式。然而,这种集成也扩大了攻击面。在物理视觉应用中,基于补丁的对抗性攻击被视为最真实的威胁模型,已在众多现有文献中得到验证。本文提出了针对补丁视觉提示注入的防御方法,其中敌对者利用对抗性补丁在VLM中生成目标内容。我们的调查发现,补丁式对抗提示对像素级随机化具有敏感性,这一特征即使针对旨在抵消此类防御的自适应攻击也保持鲁健。基于此洞见,我们引入SmoothVLM——一种基于平滑技术构建的防御机制,专为保护VLM免受补丁视觉提示注入威胁而设计。该框架在两种领先的VLM上将攻击成功率显著降低至0%至5.0%之间,同时实现约67.3%至95.0%的良性图像上下文恢复,显示出安全性与可用性之间的平衡。

关键词

引用

@article{arxiv.2405.10529,
  title  = {Safeguarding Vision-Language Models Against Patched Visual Prompt Injectors},
  author = {Jiachen Sun and Changsheng Wang and Jiongxiao Wang and Yiwei Zhang and Chaowei Xiao},
  journal= {arXiv preprint arXiv:2405.10529},
  year   = {2024}
}

备注

15 pages