中文

在野生环境中,视觉语言模型是否安全?基于梗图的基准研究

计算与语言 2025-09-24 v3 密码学与安全 计算机视觉与模式识别

摘要

视觉语言模型(VLM)的快速部署加剧了安全风险,但大多数评估仍依赖人工制作图像。本研究询问:当面对普通用户分享的梗图时,当前 VLM 是否安全?为此,我们引入 MemeSafetyBench,一个包含 50,430 个实例的基准数据集,将真实梗图图像配对为有害和良性指令。基于全面的安全分类体系和基于大语言模型的指令生成方法,我们评估了多个 VLM 在单轮和多轮交互中的表现。我们研究了真实梗图如何影响有害输出,交互情境的缓解效果,以及模型规模与安全指标之间的关系。我们的发现表明,VLM 对基于梗图的有害提示比对合成图像或排版图像更为脆弱。梗图显著增加有害响应的几率,并降低拒绝响应的几率。尽管多轮交互提供了部分缓解,但仍保持 elevated 的脆弱性。这些结果凸显了生态学有效评估和更强安全机制的必要性。MemeSafetyBench 已公开于 https://github.com/oneonlee/Meme-Safety-Bench。

关键词

引用

@article{arxiv.2505.15389,
  title  = {Are Vision-Language Models Safe in the Wild? A Meme-Based Benchmark Study},
  author = {DongGeon Lee and Joonwon Jang and Jihae Jeong and Hwanjo Yu},
  journal= {arXiv preprint arXiv:2505.15389},
  year   = {2025}
}

备注

Accepted to EMNLP 2025