双模基准测试:衡量视觉语言模型中的过度拒绝与鲁棒性
计算与语言
2026-03-20 v3
摘要
随着视觉语言模型(VLMs)日益强大,如何在安全性和实用性之间取得平衡仍是核心挑战。虽然安全机制至关重要,但可能适得其反,导致模型对恶意请求产生过度拒绝,即模型出于过度谨慎而拒绝了合理请求。然而,目前缺乏系统性地针对视觉模态中过度拒绝问题设计基准测试的工作。这种设置带来独特挑战,例如双用途场景:指令本身无害,但伴随的图像包含有害内容。在此类情境中,模型常常表现不稳,要么过于保守地拒绝,要么毫无防备地生成危险内容,这凸显了更细粒度对齐的必要性。理想行为应为安全完成,即在满足请求中无害部分的同时,对任何可能的有害元素进行明确警告。为此,我们提出 DUAL-Bench,这是一个聚焦于视觉语言模型中过度拒绝与安全完成的大规模多模态基准测试。我们评估了 18 个视觉语言模型,在 12 个危险类别下进行语义保持的视觉扰动测试。双用途场景下,模型显示出极其脆弱的安全边界。它们陷入二元陷阱:要么过于敏感地直接拒绝,要么毫无防备地生成危险内容。因此,即便是表现最好的模型 GPT-5-Nano,仅达到 12.9% 的安全完成率,GPT-5 和 Qwen 系列平均分别为 7.9% 和 3.9%。我们希望 DUAL-Bench 能促进多模态安全性和实用性之间更细致的对齐策略。内容警告:本文包含敏感且可能有害内容的示例。
引用
@article{arxiv.2510.10846,
title = {DUAL-Bench: Measuring Over-Refusal and Robustness in Vision-Language Models},
author = {Kaixuan Ren and Preslav Nakov and Usman Naseem},
journal= {arXiv preprint arXiv:2510.10846},
year = {2026}
}
备注
26pages, 13 figures, Preprint