中文

VLSBench:揭示多模态安全中的视觉泄漏

密码学与安全 2025-05-20 v3 人工智能 计算与语言 计算机视觉与模式识别

摘要

多模态大语言模型(MLLMs)的安全问题正在逐渐成为各种应用中的重要问题。令人意外的是,先前的工作表明,使用文本取消学习对齐 MLLMs 能获得与使用图像文本对齐的相当的安全性能。为解释这种现象,我们发现现有多模态安全基准中存在视觉安全信息泄漏(VSIL)问题,即图像中潜在的风险内容已在文本查询中被揭示。因此,MLLMs 可以仅通过文本查询轻松拒绝这些敏感的图像文本对,导致对 MLLMs 跨模态安全评估不可靠。我们还进一步在文本对齐和多模态对齐之间进行了比较实验,以突出这一缺陷。为此,我们通过自动化数据管道构建了包含 2.2k 图像文本对的多模态泄漏无声安全基准(VLSBench)。实验结果表明,VLSBench 对开源和闭源 MLLMs(如 LLaVA、Qwen2-VL 和 GPT-4o)都提出了重大挑战。此外,我们在 VLSBench 上经验性地比较了文本对齐和多模态对齐方法,发现针对存在 VSIL 的安全场景,文本对齐已足够有效;而针对不存在 VSIL 的安全场景,多模态对齐更为可取。代码和数据已在 https://github.com/AI45Lab/VLSBench 上发布。

关键词

引用

@article{arxiv.2411.19939,
  title  = {VLSBench: Unveiling Visual Leakage in Multimodal Safety},
  author = {Xuhao Hu and Dongrui Liu and Hao Li and Xuanjing Huang and Jing Shao},
  journal= {arXiv preprint arXiv:2411.19939},
  year   = {2025}
}

备注

ACL2025 Main