中文

RedDiffuser:通过强化扩散审计视觉语言模型中的多模态安全失效

计算机视觉与模式识别 2026-05-11 v5

摘要

大型视觉语言模型 (VLMs) 越来越多地部署在开放环境中,在此环境中确保多模态输入下的可靠安全性至关重要。然而,现有的评估在很大程度上仍以指令为中心,侧重于显式的恶意查询,却忽略了一个更现实且尚未充分探索的风险:安全对齐在有害上下文暴露下是否依然保持鲁棒。这一局限性对于多模态系统尤为重要,因为视觉输入可以极大地引导模型行为,使得纯文本审计显得不足。在这项工作中,我们研究有害上下文暴露下的多模态安全审计,探讨当部分有毒文本与视觉上下文配对时,VLMs 能否保持安全行为。为了实现系统性审计,我们提出了 RedDiffuser (RedDiff),这是一个基于强化的框架,利用扩散模型为黑盒安全测试生成语义连贯的视觉输入。通过将贪婪提示搜索与强化优化相结合,RedDiffuser 揭示了暴露潜在安全失效的高风险多模态输入。在开源和商业 VLMs 上的大量实验表明,这种上下文条件下的失效是普遍存在的。在 LLaVA 上,RedDiffuser 在原始集上将不安全响应率提高了 10.69%,在留出集上提高了 8.91%,并且对 Gemini 和 LLaMA-Vision 具有很强的可迁移性。即使在外部安全护栏下,这些漏洞依然存在,这表明当前的系统级安全机制对于现实的多模态风险仍然不足。我们的发现揭示了现有安全评估中的一个关键盲点,并将上下文感知的多模态审计确立为诊断现代 VLM 系统中隐藏漏洞的重要范式。

关键词

引用

@article{arxiv.2503.06223,
  title  = {RedDiffuser: Auditing Multimodal Safety Failures in Vision-Language Models via Reinforced Diffusion},
  author = {Ruofan Wang and Xingjun Ma},
  journal= {arXiv preprint arXiv:2503.06223},
  year   = {2026}
}