中文

Lingua-SafetyBench:用于评估多语言视觉语言模型安全性的基准

计算机视觉与模式识别 2026-04-22 v2

摘要

视觉语言大模型(VLLM)在联合多语言和多模态威胁下的鲁健性安全性仍严重未被探索。当前基准通常将这些维度隔离开来,要么是多语言但仅文本,要么是多模态但单语言。虽然最近的红队测试尝试通过将有害提示渲染为图像来弥合这一差距,但过度依赖字体样式图像且缺乏语义上符合图像-文本配对,无法捕捉在多语言和多模态条件下的真实跨模态交互。为此,我们引入Lingua-SafetyBench,一个涵盖10种语言、包含100,440个有害图像-文本对的全面基准。关键的是,Lingua-SafetyBench明确将数据划分为图像主导和文本主导子集,以精确消除风险来源。广泛的评估显示,当前VLLM在这些联合输入下仍保留着显著的脆弱性。就语言而言,Non-High-Resource Languages(Non-HRLs)和非拉丁字符脚本通常构成更大的威胁。此外,分析模态-语言交互后发现,一个惊人的对称性:在High-Resource Languages(HRLs)中,模型对图像主导风险最为脆弱,而在Non-HRLs中,文本主导风险严重损害安全性能。最后,针对Qwen系列模型的控制研究表明,虽然模型规模扩大和迭代升级整体上改善了安全性,但在HRLs中效果尤其显著。这加剧了HRLs和Non-HRLs在文本主导风险下的安全差距,凸显仅靠规模扩大无法实现鲁健的安全性安全,需要专门的语言和模态感知的对齐策略。该项目的代码和数据集将在https://github.com/zsxr15/Lingua-SafetyBench提供。警告:本文包含不安全内容示例。

关键词

引用

@article{arxiv.2601.22737,
  title  = {Lingua-SafetyBench: A Benchmark for Safety Evaluation of Multilingual Vision-Language Models},
  author = {Enyi Shi and Pengyang Shao and Yanxin Zhang and Chenhang Cui and Jiayi Lyu and Xiaobo Xia and Fei Shen and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2601.22737},
  year   = {2026}
}