中文

聪明的副作用:多模态大语言模型多图像推理中的安全风险

计算机视觉与模式识别 2026-01-21 v1 计算与语言

摘要

随着多模态大语言模型(MLLMs)获得更强的推理能力以处理复杂的多图像指令,这一进步可能带来新的安全风险。我们通过引入MIR-SafetyBench来研究这个问题,这是首个专注于多图像推理安全的基准,包含跨越9种多图像关系分类的2,676个实例。我们对19个MLLMs的广泛评估揭示了一个令人担忧的趋势:具有更先进多图像推理能力的模型在MIR-SafetyBench上可能更脆弱。除了攻击成功率,我们发现许多被标记为安全的响应是表面的,通常由误解或回避性、不置可否的回复驱动。我们进一步观察到,不安全的生成平均表现出比安全的生成更低的注意力熵。这种内部特征表明了一种可能的风险,即模型可能过度专注于任务解决而忽视了安全约束。我们的代码和数据可在https://github.com/thu-coai/MIR-SafetyBench获取。

关键词

引用

@article{arxiv.2601.14127,
  title  = {The Side Effects of Being Smart: Safety Risks in MLLMs' Multi-Image Reasoning},
  author = {Renmiao Chen and Yida Lu and Shiyao Cui and Xuan Ouyang and Victor Shea-Jay Huang and Shumin Zhang and Chengwei Pan and Han Qiu and Minlie Huang},
  journal= {arXiv preprint arXiv:2601.14127},
  year   = {2026}
}

备注

*15 pages, 5 figures. Introduces MIR-SafetyBench (2,676 instances; 9 multi-image relations). Equal contribution; {\dag}Corresponding author. Code/data: https://github.com/thu-coai/MIR-SafetyBench