中文

当“图文思考”遇上安全:什么决定了多模态越狱鲁棒性?

计算机视觉与模式识别 2026-05-28 v1 人工智能 计算与语言 密码学与安全 机器学习

摘要

图文推理正成为大型视觉-语言模型的一种新兴推理范式,但其安全性影响仍知之甚少。现有系统已涵盖多种流程设计,包括直接响应生成、纯文本前置轮次、视觉状态操作以及显式外部图像工具调用。在本文中,我们探究这些评估范式中的哪一种能提高多模态越狱鲁棒性,以及其原因。在多个视觉-语言模型上,我们的实验表明,显式图像工具交互在所有评估模型中取得了最低的攻击成功率,平均相对降低了约30%的越狱成功率。这一发现起初令人惊讶:即使返回的图像工具输出被人为覆盖或本身看起来不安全,ASR仍然很低,但在纯文本前置轮次控制下,ASR又恢复到接近直接回答的水平。这些结果表明,较低的ASR不能由良性的返回图像语义或仅凭文本图像工具轨迹来解释。为了解释这一模式,我们引入了一个图像工具安全向量框架,该框架将图像工具调用建模为隐藏表示向安全相关方向的残差偏移。表示层面的分析和激活干预支持了这一解释。总体而言,我们的结果表明,显式图像工具交互是提高越狱鲁棒性的一种有前景的设计模式,同时也促使需要进行特定于流程的安全性评估。

关键词

引用

@article{arxiv.2605.27932,
  title  = {When Think-with-Image Meets Safety: What Determines Multimodal Jailbreak Robustness?},
  author = {Yuan Tian and Bing Hu and Fang Wu and Xiaomin Li and Binghang Lu and Neil Zhenqiang Gong},
  journal= {arXiv preprint arXiv:2605.27932},
  year   = {2026}
}

备注

17 pages, 6 figures, 7 tables