中文

IDEATOR:利用大型视觉语言模型自身进行越狱攻击与基准测试

计算机视觉与模式识别 2025-09-26 v6 人工智能

摘要

随着大型视觉语言模型(VLMs)的普及,确保其安全部署已成为关键。近期研究探索了VLMs对越狱攻击的鲁棒性——即利用模型漏洞来诱发有害输出的技术。然而,多模态数据的有限可用性使得当前方法严重依赖从有害文本数据集中派生的对抗性或人工设计的图像,这些图像在不同语境中往往缺乏有效性和多样性。在本文中,我们提出了IDEATOR,一种新颖的越狱方法,能够自主生成恶意图像-文本对用于黑盒越狱攻击。IDEATOR基于一个洞察:VLMs本身可以作为强大的红队模型来生成多模态越狱提示。具体而言,IDEATOR利用一个VLM创建目标越狱文本,并将其与由最先进的扩散模型生成的越狱图像配对。大量实验证明了IDEATOR的高有效性和迁移性,在仅平均5.34次查询的情况下,对MiniGPT-4实现了94%的攻击成功率(ASR),在迁移到LLaVA、InstructBLIP和Chameleon时分别取得了82%、88%和75%的高ASR。基于IDEATOR的强大迁移性和自动化流程,我们引入了VLJailbreakBench,一个包含3,654个多模态越狱样本的安全基准。我们对11个近期发布的VLMs的基准测试结果揭示了安全对齐方面的显著差距。例如,我们的挑战集在GPT-4o上取得了46.31%的ASR,在Claude-3.5-Sonnet上取得了19.65%的ASR,强调了加强防御的紧迫性。VLJailbreakBench在https://roywang021.github.io/VLJailbreakBench上公开可用。

关键词

引用

@article{arxiv.2411.00827,
  title  = {IDEATOR: Jailbreaking and Benchmarking Large Vision-Language Models Using Themselves},
  author = {Ruofan Wang and Juncheng Li and Yixu Wang and Bo Wang and Xiaosen Wang and Yan Teng and Yingchun Wang and Xingjun Ma and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2411.00827},
  year   = {2025}
}