MM-SafetyBench:多模态大语言模型安全性评估基准
计算机视觉与模式识别
2024-06-21 v5
摘要
围绕大语言模型(LLMs)的安全问题已被广泛探讨,但多模态大语言模型(MLLMs)的安全性仍研究不足。本文中,我们观察到多模态大语言模型(MLLMs)易被与查询相关的图像攻破,仿佛文本查询本身恶意一般。为此,我们引入 MM-SafetyBench,一个专为针对此类基于图像的操纵对 MLLMs 进行安全关键评估而设计的综合框架。我们编制了一个包含 13 种场景的数据集,共计 5,040 个文本-图像对。我们对 12 个前沿模型的分析表明,即便所配备的 LLM 已做安全对齐,MLLMs 仍易受我们方法引发的突破。对此,我们提出一种简单而有效的提示策略,以增强 MLLMs 对此类攻击的抵御力。我们的工作凸显了需协同努力以加强开源 MLLMs 针对潜在恶意利用的安全措施的必要性。资源见 https://github.com/isXinLiu/MM-SafetyBench
引用
@article{arxiv.2311.17600,
title = {MM-SafetyBench: A Benchmark for Safety Evaluation of Multimodal Large Language Models},
author = {Xin Liu and Yichen Zhu and Jindong Gu and Yunshi Lan and Chao Yang and Yu Qiao},
journal= {arXiv preprint arXiv:2311.17600},
year = {2024}
}