中文

MOSSBench: 你的多模态语言模型对安全查询过度敏感吗?

计算与语言 2024-06-27 v1 人工智能 密码学与安全 计算机视觉与模式识别 机器学习

摘要

人类容易产生认知扭曲——一种有偏见的思维模式,导致对特定刺激产生夸大反应,尽管情境截然不同。本文证明,先进的多模态大语言模型(MLLMs)也表现出类似倾向。尽管这些模型被设计为在安全机制下响应查询,但它们有时会在某些视觉刺激存在时拒绝无害查询,而忽略其上下文的良性性质。作为研究此行为的初步步骤,我们识别出三种触发现有MLLMs过度敏感的刺激类型:夸大风险、否定伤害和反直觉解释。为了系统评估MLLMs对这些刺激的过度敏感性,我们提出了多模态过度敏感基准(MOSSBench)。该工具包包含300个手动收集的良性多模态查询,并由第三方评审员(AMT)交叉验证。使用MOSSBench对20个MLLMs进行的实证研究揭示了若干见解:(1). 过度敏感在SOTA MLLMs中普遍存在,对无害查询的拒绝率高达76%。(2). 更安全的模型更过度敏感:增加安全性可能会无意中提高模型响应中的谨慎和保守性。(3). 不同类型的刺激往往在MLLMs响应过程的特定阶段——感知、意图推理和安全判断——导致错误。这些发现凸显了需要精细化的安全机制,以在谨慎与上下文适当的响应之间取得平衡,从而提高MLLMs在实际应用中的可靠性。我们的项目可在 https://turningpoint-ai.github.io/MOSSBench/ 获取。

关键词

引用

@article{arxiv.2406.17806,
  title  = {MOSSBench: Is Your Multimodal Language Model Oversensitive to Safe Queries?},
  author = {Xirui Li and Hengguang Zhou and Ruochen Wang and Tianyi Zhou and Minhao Cheng and Cho-Jui Hsieh},
  journal= {arXiv preprint arXiv:2406.17806},
  year   = {2024}
}