通用危险检测
计算机视觉与模式识别
2026-05-25 v1
摘要
危险作为一种抽象概念,通常是通过认知层面的逻辑推理来定义,而非通过具体示例。相比之下,现有的危险检测系统依赖于预定义的危险类别,并需要在检测或分类架构中密集收集标注示例。这种方法在处理抽象安全概念时面临三个根本挑战:(1) 噪声大且稀疏的训练数据;(2) 跨上下文和时间动态演变的定义;(3) 对未见或新场景的泛化能力有限。为了解决这些局限性,我们提出了 CompliVision 数据集,这是第一个专为基于规则的合规性评估而设计的通用危险数据集,并附带一个危险评估基线框架。我们的核心创新是通过基于语言的规则表达安全需求,从而将危险概念与基于图像的示例解耦。我们以权威领域法规和 ISO 标准为基础,定义了跨多个领域的多样化危险概念。CompliVision 数据集包含 3,006 张涵盖交通、建筑和仓库环境的图像,每张图像均针对特定安全规则进行了合规性标注,并附有突出显示支持性视觉证据的自然语言解释。为了实现稳健的泛化,我们开发了一个主动学习框架,以更有效地引导和优化视觉语言模型评估危险合规性。尽管最先进的 VLM 展现出强大的能力,但它们在准确安全评估所需的细粒度、上下文相关解释方面仍存在困难。我们提出了一个通用危险检测框架来解决这一局限性,该框架将基于 LLaVA 的视觉推理与人在回路反馈相结合。
引用
@article{arxiv.2605.23304,
title = {General Hazard Detection},
author = {Stephanie Ng and CP Lim and SueJen Looi and Hendrik Zurlinden and David Nguyen and Lei Wei and Saeid Nahavandi and Hailing Zhou},
journal= {arXiv preprint arXiv:2605.23304},
year = {2026}
}
备注
20 pages, 7 figures and 4 tables