中文

难以阅读,却易被越狱:视觉退化如何绕过MLLM安全对齐

计算机视觉与模式识别 2026-05-11 v1 人工智能

摘要

最近的视觉上下文压缩技术使MLLM能够高效处理超长上下文,通过将文本渲染为图像。然而,我们发现这一范式固有的关键漏洞:降低图像分辨率不慎不敢地催化了越狱。我们的实验显示,SOTA模型的安全防御随分辨率下降而显著恶化,令人惊讶的是,即使文本仍然可辨,恶化也依然存在。我们将其归因于“认知过载”,假设解译退化输入所需的 effort 会转移注意力资源 away于安全审计。这种现象在各种视觉扰动(包括噪声和几何畸变)中均得到验证。为此,我们提出一种简单的“结构化认知卸载”策略,通过强制序列化管道来解耦视觉转录与安全评估,从而缓解这些风险。我们的工作暴露了视觉压缩中存在的重大风险,并为未来MLLM的安全设计提供了关键见解。

关键词

引用

@article{arxiv.2605.07250,
  title  = {Hard to Read, Easy to Jailbreak: How Visual Degradation Bypasses MLLM Safety Alignment},
  author = {Zhixue Song and Boyan Han and Yiwei Wang and Chi Zhang},
  journal= {arXiv preprint arXiv:2605.07250},
  year   = {2026}
}

备注

Accepted to Findings of ACL 2026