难以阅读,却易被越狱:视觉退化如何绕过MLLM安全对齐
计算机视觉与模式识别
2026-05-11 v1 人工智能
摘要
最近的视觉上下文压缩技术使MLLM能够高效处理超长上下文,通过将文本渲染为图像。然而,我们发现这一范式固有的关键漏洞:降低图像分辨率不慎不敢地催化了越狱。我们的实验显示,SOTA模型的安全防御随分辨率下降而显著恶化,令人惊讶的是,即使文本仍然可辨,恶化也依然存在。我们将其归因于“认知过载”,假设解译退化输入所需的 effort 会转移注意力资源 away于安全审计。这种现象在各种视觉扰动(包括噪声和几何畸变)中均得到验证。为此,我们提出一种简单的“结构化认知卸载”策略,通过强制序列化管道来解耦视觉转录与安全评估,从而缓解这些风险。我们的工作暴露了视觉压缩中存在的重大风险,并为未来MLLM的安全设计提供了关键见解。
引用
@article{arxiv.2605.07250,
title = {Hard to Read, Easy to Jailbreak: How Visual Degradation Bypasses MLLM Safety Alignment},
author = {Zhixue Song and Boyan Han and Yiwei Wang and Chi Zhang},
journal= {arXiv preprint arXiv:2605.07250},
year = {2026}
}
备注
Accepted to Findings of ACL 2026