中文

通过多模态推理对视觉语言模型进行越狱攻击

计算机视觉与模式识别 2026-02-02 v1 人工智能

摘要

视觉语言模型(VLM)已成为视觉问答、图像描述和文本到图像生成等任务的核心。然而,其输出对提示变体极其敏感,这些变体可揭示安全对齐的漏洞。本文提出了一种越狱框架,利用后训练链式思考(CoT)提示构建能够绕过安全过滤器的隐形提示。为进一步提高攻击成功率(ASR),我们提出了基于 ReAct 的自适应无噪机制,通过模型反馈迭代扰动输入图像。该方法利用 ReAct 范式细化对抗噪声,聚焦于最可能激活安全防御的区域,从而增强其隐形性和规避性。实验结果表明,所提出的双策略显著提高了 ASR,同时在文本和视觉领域保持自然性。

关键词

引用

@article{arxiv.2601.22398,
  title  = {Jailbreaks on Vision Language Model via Multimodal Reasoning},
  author = {Aarush Noheria and Yuguang Yao},
  journal= {arXiv preprint arXiv:2601.22398},
  year   = {2026}
}