中文

超越视觉安全:通过语义无关输入越狱多模态大语言模型以生成有害图像

计算机视觉与模式识别 2026-01-23 v1 人工智能

摘要

多模态大语言模型(MLLMs)的快速发展带来了复杂的安全挑战,尤其是在文本安全与视觉安全的交叉领域。尽管现有方案已探索了MLLMs的安全漏洞,但对其视觉安全边界的研究仍不充分。本文提出超越视觉安全(BVS),一种新颖的图像-文本对越狱框架,专门设计用于探测MLLMs的视觉安全边界。BVS采用“重构-再生成”策略,利用中性化视觉拼接和归纳重组将恶意意图与原始输入解耦,从而诱导MLLMs生成有害图像。实验结果表明,BVS针对GPT-5(2026年1月12日发布版)实现了98.21%的显著越狱成功率。我们的发现揭示了当前MLLMs在视觉安全对齐方面的关键漏洞。

关键词

引用

@article{arxiv.2601.15698,
  title  = {Beyond Visual Safety: Jailbreaking Multimodal Large Language Models for Harmful Image Generation via Semantic-Agnostic Inputs},
  author = {Mingyu Yu and Lana Liu and Zhehao Zhao and Wei Wang and Sujuan Qin},
  journal= {arXiv preprint arXiv:2601.15698},
  year   = {2026}
}