视觉语言安全理解:映射AI安全的联合多模态理解极限
计算机视觉与模式识别
2025-12-04 v2 人工智能
计算与语言
机器学习
摘要
多模态基础模型的安全评估常将视觉和语言输入分别处理,忽略了联合解读潜在风险——良性内容在组合后可能产生危害。现有方法也难以明确区分不安全内容与边缘案例,导致过度屏蔽或不足拒绝真正有害内容。我们提出视觉语言安全理解(VLSU),一个系统性评估多模态安全的框架,通过细粒度严重程度分类和跨17种安全模式的组合分析。我们采用多阶段管道,结合真实图像和人工标注,构建规模为8,187个样本、覆盖15类伤害类别的大型基准数据集。我们评估了十一款最先进模型,揭示了系统性的联合理解缺陷:尽管模型在明显的单模态安全信号上达到90%以上的准确率,但在需要联合图像-文本推理才能确定安全标签的情形下,性能显著下降至20-55%。更关键的是,尽管单模态安全分类正确,34%的联合图像-文本安全分类错误仍发生,进一步表明缺乏组合推理能力。此外,我们发现模型在拒绝不安全内容与回应值得互动的边缘案例之间难以平衡。例如,我们发现指令性语言可将Gemini-1.5在边缘内容上的过度屏蔽率从62.4%降至10.4%,但以牺牲不安全内容的拒绝率为代价——拒绝率从90.8%降至53.9%。总体而言,我们的框架暴露了联合图像-文本理解的弱点,揭示了当前模型中的对齐差距,并为下一阶段在鲁健视觉语言安全研究提供了关键测试平台。
引用
@article{arxiv.2510.18214,
title = {VLSU: Mapping the Limits of Joint Multimodal Understanding for AI Safety},
author = {Shruti Palaskar and Leon Gatys and Mona Abdelrahman and Mar Jacobo and Larry Lindsey and Rutika Moharir and Gunnar Lund and Yang Xu and Navid Shiee and Jeffrey Bigham and Charles Maalouf and Joseph Yitan Cheng},
journal= {arXiv preprint arXiv:2510.18214},
year = {2025}
}
备注
10 pages, 5 figures, 4 tables, detailed appendix. Under review