通过视觉模态突破视觉语言模型的安全对齐
计算机视觉与模式识别
2026-05-04 v1 人工智能
机器学习
摘要
视觉语言模型(VLM)的视觉模态是一种未被充分探索的攻击面,可用于绕过安全对齐。我们引入四种利用视觉组件的破解攻击:(1) 将有害指令编码为视觉符号序列并配以解码图例,(2) 用良性替代品替换有害对象(如炸弹→香蕉),然后使用替代术语请求有害操作,(3) 替换图像中的有害文本(如书封面上的文字)为良性词汇,同时视觉语境保留原意,(4) 视觉类比拼图,其解决方案需要推断被禁止的概念。在评估六个前沿 VLM 时,我们的视觉攻击绕过了安全对齐,暴露了跨模态对齐差距:基于文本的安全训练并不自动推广到通过视觉表达的有害意图。例如,我们的视觉密码在 Claude-Haiku-4.5 上的攻击成功率为 40.9%,而等效文本密码仅为 10.7%。为进一步理解攻击机制,我们提供初步的可解释性和缓解措施结果。这些发现表明,健全的 VLM 对齐需要将视觉模态作为安全微调的第一目标。
引用
@article{arxiv.2605.00583,
title = {Jailbreaking Vision-Language Models Through the Visual Modality},
author = {Aharon Azulay and Jan Dubiński and Zhuoyun Li and Atharv Mittal and Yossi Gandelsman},
journal= {arXiv preprint arXiv:2605.00583},
year = {2026}
}
备注
Accepted to ICML 2026