多模态语言模型的红队测试:跨提示模态与模型的伤害评估
计算与语言
2025-11-25 v2
摘要
多模态大语言模型(MLLMs)在实际应用中日益受到使用,但在对抗条件下的安全性仍未得到充分探索。本研究评估了四个领先的 MLLMs(GPT-4o、Claude Sonnet 3.5、Pixtral 12B 和 Qwen VL Plus)在跨文本唯一和多模态格式的对抗提示下的无害性。26 名红队成员生成了 726 条针对三个伤害类别(非法活动、虚假信息和不道德行为)的提示。这些提示被提交给每个模型,17 名注释员对 2904 条模型输出进行分类,以 5 分尺度评估其 harmfulness。结果显示不同模型和模态之间的脆弱性存在显著差异。Pixtral 12B 的有害响应率最高(约 62%),而 Claude Sonnet 3.5 则最具抵抗力(约 10%)。与预期相反,文本唯一提示在绕过安全机制方面略微比多模态提示更有效。统计分析确认,模型类型和输入模态都是 harmfulness 的显著预测因子。这些发现凸显了随着 MLLMs 更广泛部署,对鲁棒、多模态安全基准的紧迫需求。
引用
@article{arxiv.2509.15478,
title = {Red Teaming Multimodal Language Models: Evaluating Harm Across Prompt Modalities and Models},
author = {Madison Van Doren and Casey Ford},
journal= {arXiv preprint arXiv:2509.15478},
year = {2025}
}