中文

OmniSafeBench-MM:多模态越狱攻防评估的统一基准与工具箱

密码学与安全 2025-12-09 v1 计算机视觉与模式识别

摘要

近期多模态大语言模型 (MLLM) 的进展使其具备统一的感知-推理能力,但这些系统仍高度脆弱,容易遭受越狱攻击,后者可规避安全对齐并诱发有害行为。现有基准如 JailBreakV-28K、MM-SafetyBench 和 HADES 提供了宝贵的多模态漏洞洞察,但它们通常聚焦于有限的攻击场景,缺乏标准化的防御评估,且不提供统一、可复现的工具箱。为填补这一空白,我们引入 OmniSafeBench-MM,这是一个用于多模态越狱攻防评估的综合性工具箱。OmniSafeBench-MM 集成了 13 种代表性攻击方法、15 种防御策略,以及覆盖 9 大风险领域和 50 个细粒度类别的多样化数据集,结构化为咨询式、命令式和陈述式询问类型,以反映真实的用户意图。除数据覆盖之外,它建立了三维评估协议,衡量(1)有害性,由从低影响个体伤害到灾难性社会威胁的细粒度多层次比例尺区分;(2)响应与查询之间的意图对齐;以及(3)响应细节水平,实现细致的安全-实用性分析。我们在 10 个开源和 8 个闭源 MLLMs 上进行了大规模实验,揭示了这些模型在多模态越狱攻击下的脆弱性。通过将数据、方法和评估统一为开源、可复现的平台,OmniSafeBench-MM 为未来研究提供了标准化基础。代码已发布于 https://github.com/jiaxiaojunQAQ/OmniSafeBench-MM。

关键词

引用

@article{arxiv.2512.06589,
  title  = {OmniSafeBench-MM: A Unified Benchmark and Toolbox for Multimodal Jailbreak Attack-Defense Evaluation},
  author = {Xiaojun Jia and Jie Liao and Qi Guo and Teng Ma and Simeng Qin and Ranjie Duan and Tianlin Li and Yihao Huang and Zhitao Zeng and Dongxian Wu and Yiming Li and Wenqi Ren and Xiaochun Cao and Yang Liu},
  journal= {arXiv preprint arXiv:2512.06589},
  year   = {2025}
}