为何弱OOD有效?迈向理解VLM越狱的进一步探索
密码学与安全
2025-11-12 v1
摘要
大型视觉语言模型容易受到越狱攻击:研究人员已开发出多种能够成功绕过VLM安全机制的攻击策略。其中,基于分布外(OOD)策略的越狱方法因其简单性和有效性而受到广泛关注。本文进一步推进了对基于OOD的VLM越狱方法的深入理解。实验结果表明,通过温和OOD策略生成的越狱样本在规避VLM安全约束方面表现出更优的性能——我们将这一现象定义为“弱OOD”。为揭示该现象背后的原因,本研究以典型的基于OOD的越狱方法SI-Attack为研究对象。我们将该现象归因于两个主导因素之间的权衡:输入意图感知与模型拒答触发。这两个因素对OOD操纵的响应不一致导致了该现象的产生。此外,我们从模型预训练与对齐过程之间差异的视角,为这种不一致的必然性提供了理论论证。基于上述洞察,我们从光学字符识别(OCR)能力增强——主流VLM预训练阶段的核心任务——中汲取灵感。利用该能力,我们设计了一种简单而高效的VLM越狱方法,其性能优于SOTA基线。
引用
@article{arxiv.2511.08367,
title = {Why does weak-OOD help? A Further Step Towards Understanding Jailbreaking VLMs},
author = {Yuxuan Zhou and Yuzhao Peng and Yang Bai and Kuofeng Gao and Yihao Zhang and Yechao Zhang and Xun Chen and Tao Yu and Tao Dai and Shu-Tao Xia},
journal= {arXiv preprint arXiv:2511.08367},
year = {2025}
}