中文

只见树木,不见森林:多模态大语言模型多模态安全意识基准测试

计算与语言 2025-06-04 v2 人工智能 计算机视觉与模式识别 多媒体

摘要

多模态大语言模型(MLLMs)通过同时支持文本和图像交互,扩展了传统语言模型的能力。然而,确保这些模型的安全性仍然是一个重大挑战,特别是在准确识别多模态内容是否安全方面——我们称之为安全意识。在本文中,我们提出了 MMSafeAware,这是第一个全面的多模态安全意识基准测试,旨在跨 29 个安全场景评估 MLLMs,包含 1500 个精心策划的图像-提示对。MMSafeAware 包含不安全子集和过度安全子集,以评估模型正确识别不安全内容的能力,以及避免过度敏感从而妨碍实用性的能力。使用 MMSafeAware 评估九种广泛使用的 MLLMs 发现,当前模型的安全性不足且常常过度敏感;例如,GPT-4V 将 36.1% 的不安全输入误判为安全,将 59.9% 的良性输入误判为不安全。我们进一步探索了三种提高安全意识的方法——基于提示的方法、视觉对比解码和以视觉为中心的推理微调——但发现均未达到令人满意的性能。我们的发现凸显了开发具有鲁棒安全意识的多模态大语言模型所面临的深刻挑战,强调了该领域需要进一步研究。所有代码和数据将公开发布,以促进未来研究。

关键词

引用

@article{arxiv.2502.11184,
  title  = {Can't See the Forest for the Trees: Benchmarking Multimodal Safety Awareness for Multimodal LLMs},
  author = {Wenxuan Wang and Xiaoyuan Liu and Kuiyi Gao and Jen-tse Huang and Youliang Yuan and Pinjia He and Shuai Wang and Zhaopeng Tu},
  journal= {arXiv preprint arXiv:2502.11184},
  year   = {2025}
}

备注

Accepted by ACL 2025