文本就是你所需的视觉语言模型越狱
计算机视觉与模式识别
2026-02-03 v1 人工智能
密码学与安全
摘要
大型视觉语言模型(LVLMs)正不断增强其 robust safety 措施,以防止对有害或不允许的查询作出响应。然而,这些防御通常只关注分析explicit textual 输入或相关的视觉场景。在本工作中,我们引入了Text-DJ,这是一种新型越狱攻击,通过利用模型的Optical Character Recognition(OCR)能力来绕过这些安全措施。我们的方法包含三个阶段。首先,我们将单个有害查询分解为多个语义相关但更温和的子查询。其次,我们选取一组与有害查询最大不相关的干扰查询。最后,我们将所有分解后的子查询和干扰查询同时呈现给LVMM,以网格状图像形式呈现,其中子查询的位置位于网格的中间。我们展示了该方法成功绕过了最先进LVMM的安全对齐。我们认为该攻击之所以成功,是因为(1)将基于文本的查询转换为图像,绕过了基于文本的过滤器,以及(2)诱导干扰,使得模型的安全协议未能在大量无关查询中将分散的子查询进行关联。总体而言,我们的发现揭示了LVMM OCR能力在面对分散的多图像对抗输入时并不稳健的关键漏洞,凸显了针对碎片化多模态输入防御的需求。
引用
@article{arxiv.2602.00420,
title = {Text is All You Need for Vision-Language Model Jailbreaking},
author = {Yihang Chen and Zhao Xu and Youyuan Jiang and Tianle Zheng and Cho-Jui Hsieh},
journal= {arXiv preprint arXiv:2602.00420},
year = {2026}
}