UniSAFE:用于统一多模态模型安全评估的全面基准
计算机视觉与模式识别
2026-03-19 v1 人工智能
计算与语言
摘要
统一多模态模型(UMMs)提供强大的跨模态能力,但引入了在单任务模型中未观察到的新的安全风险。尽管它们已出现,但现有的安全基准仍在任务和模态之间碎片化,限制了对复杂系统级漏洞的全面评估。为填补这一差距,我们引入 UniSAFE,这是首个用于 UMMs 系统级安全评估的全面基准,涵盖 7 种输入输出模态组合,涵盖常规任务和新颖的多模态语境图像生成设置。UniSAFE 采用共享目标设计,将常见风险情景投影到任务特定的输入输出配置之上,实现了对安全失效的受控跨任务比较。由 6802 个精选实例组成的基准用于评估 15 个最先进的 UMMs,包括专有和开源模型。我们的结果揭示了当前 UMMs 存在的关键漏洞,包括在多图像组合和多轮设置中的 elevated 安全违规,图像输出任务始终比文本输出任务更易受攻击。这些发现突显了为 UMMs 构建更强系统级安全对齐的必要性。我们的代码和数据已公开于 https://github.com/segyulee/UniSAFE
引用
@article{arxiv.2603.17476,
title = {UniSAFE: A Comprehensive Benchmark for Safety Evaluation of Unified Multimodal Models},
author = {Segyu Lee and Boryeong Cho and Hojung Jung and Seokhyun An and Juhyeong Kim and Jaehyun Kwak and Yongjin Yang and Sangwon Jang and Youngrok Park and Wonjun Chang and Se-Young Yun},
journal= {arXiv preprint arXiv:2603.17476},
year = {2026}
}
备注
Equal contribution by first three authors, 55 pages