中文

MM-SafetyBench:多模态大语言模型安全性评估基准

计算机视觉与模式识别 2024-06-21 v5

摘要

围绕大语言模型(LLMs)的安全问题已被广泛探讨,但多模态大语言模型(MLLMs)的安全性仍研究不足。本文中,我们观察到多模态大语言模型(MLLMs)易被与查询相关的图像攻破,仿佛文本查询本身恶意一般。为此,我们引入 MM-SafetyBench,一个专为针对此类基于图像的操纵对 MLLMs 进行安全关键评估而设计的综合框架。我们编制了一个包含 13 种场景的数据集,共计 5,040 个文本-图像对。我们对 12 个前沿模型的分析表明,即便所配备的 LLM 已做安全对齐,MLLMs 仍易受我们方法引发的突破。对此,我们提出一种简单而有效的提示策略,以增强 MLLMs 对此类攻击的抵御力。我们的工作凸显了需协同努力以加强开源 MLLMs 针对潜在恶意利用的安全措施的必要性。资源见 https://github.com/isXinLiu/MM-SafetyBench

关键词

引用

@article{arxiv.2311.17600,
  title  = {MM-SafetyBench: A Benchmark for Safety Evaluation of Multimodal Large Language Models},
  author = {Xin Liu and Yichen Zhu and Jindong Gu and Yunshi Lan and Chao Yang and Yu Qiao},
  journal= {arXiv preprint arXiv:2311.17600},
  year   = {2024}
}