CSR-Bench:用于评估多模态大语言模型跨模态安全性与可靠性的基准
人工智能
2026-02-04 v1
摘要
多模态大语言模型(MLLMs)通过文本和图像进行交互,但其安全行为可能受单模态捷径驱动,而非真正的联合意图理解。我们引入 CSR-Bench,这是一个用于评估跨模态可靠性的基准,通过四种压力测试互动模式(覆盖 Safety、Over-rejection、Bias 和 Hallucination,涉及 61 种细粒度类型)进行评估。每个实例都需要集成图像和文本的解释,我们另提供配对的仅文本控制,以诊断因模态引起的行为变化。我们评估了 16 个最先进的 MLLMs,观察到系统性的跨模态对齐差距。模型表现出弱的安全意识、在干扰下的语言主导优势以及从仅文本控制到多模态输入的一致性能下降。我们还观察到减少误拒与保持安全、非歧视性行为之间存在明确的权衡,表明某些看似的安全收益可能来自拒绝导向的启发式方法,而非稳健的意图理解。WARNING:本论文包含不安全内容。
引用
@article{arxiv.2602.03263,
title = {CSR-Bench: A Benchmark for Evaluating the Cross-modal Safety and Reliability of MLLMs},
author = {Yuxuan Liu and Yuntian Shi and Kun Wang and Haoting Shen and Kun Yang},
journal= {arXiv preprint arXiv:2602.03263},
year = {2026}
}
备注
25 pages, 1 figures