USB:面向多模态大语言模型的综合统一安全评测基准
密码学与安全
2025-06-02 v1 人工智能
摘要
尽管多模态大语言模型(MLLMs)取得了显著成就并被广泛采用,但它们暴露出严重的安全漏洞,凸显了对稳健安全评测基准的迫切需求。然而,现有的 MLLM 安全基准在数据质量、覆盖范围以及模态风险组合方面存在不足,导致评测结果虚高且相互矛盾,阻碍了安全问题的发现与治理。此外,我们认为在 MLLM 安全评测中,应同时考虑对有害查询的脆弱性和对无害查询的过度敏感性,而此前这两者是被分开考虑的。在本文中,为了解决这些缺陷,我们引入了统一安全基准(Unified Safety Benchmarks, USB),这是 MLLM 安全领域最全面的评测基准之一。我们的基准具有高质量查询、广泛的风险类别、全面的模态组合,并涵盖了脆弱性和过度敏感性评测。从风险类别和模态组合两个关键维度的视角,我们证明了现有的基准——甚至是绝大多数基准的并集——都远未达到真正的全面性。为了弥补这一差距,我们设计了一个精细的数据合成流水线,生成大量高质量的互补数据,以解决此前未被探索的方面。通过将开源数据集与我们的合成数据相结合,我们的基准为 61 个风险子类别中的每一个提供了 4 种不同的模态组合,在脆弱性和过度敏感性两个维度上均覆盖了英语和中文。
引用
@article{arxiv.2505.23793,
title = {USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models},
author = {Baolin Zheng and Guanlin Chen and Hongqiong Zhong and Qingyang Teng and Yingshui Tan and Zhendong Liu and Weixun Wang and Jiaheng Liu and Jian Yang and Huiyun Jing and Jincheng Wei and Wenbo Su and Xiaoyong Zhu and Bo Zheng and Kaifu Zhang},
journal= {arXiv preprint arXiv:2505.23793},
year = {2025}
}