中文

更安全总比更危险强?视觉语言模型在视觉紧急识别中的过度反应问题

计算机视觉与模式识别 2025-09-30 v3 人工智能 计算与语言

摘要

视觉-语言模型(VLMs)在解释视觉内容方面已显示出能力,但其在安全关键情境下的可靠性仍不足以被探索。我们引入 VERI,一个诊断性基准,包含 200 个合成图像(100 对对比图像)以及额外 50 个真实世界图像(25 对)用于验证。每个紧急场景都与通过人类验证的视觉上相似但安全的情境配对。使用两个阶段的评估协议(风险识别和紧急响应),我们评估了 17 个 VLMs 在医疗紧急情况、事故和自然灾害方面的表现。我们的分析揭示了“过度反应问题”:模型在召回率(70-100%)方面表现良好,但精度较低,将 31-96% 的安全情境误分类为危险。所有模型在七个安全情境中被普遍误分类。这种“更安全总比更糟”偏差源于情境过度解读(88-98% 的错误)。合成数据和真实世界数据均确认这些系统性模式,挑战了 VLM 在安全关键应用中的可靠性。需要通过增强的情境推理来解决此问题,以处理模糊的视觉情境。

关键词

引用

@article{arxiv.2505.15367,
  title  = {Better Safe Than Sorry? Overreaction Problem of Vision Language Models in Visual Emergency Recognition},
  author = {Dasol Choi and Seunghyun Lee and Youngsook Song},
  journal= {arXiv preprint arXiv:2505.15367},
  year   = {2025}
}