视觉语言模型用于多样化工作场所中可解释和细粒度的安全合规检测
计算机视觉与模式识别
2024-08-15 v1 人工智能
摘要
因个人防护装备 (PPE) 不合规导致的工作场所事故引发严重的安全问题,并导致法律责任、经济处罚和声誉损害。虽然目标检测模型已展现出通过识别安全物品解决此问题的能力,但大多数现有模型(如 YOLO、Faster R-CNN 和 SSD)在跨多样化工作场所场景验证 PPE 的细粒度属性方面存在局限。视觉语言模型 (VLMs) 通过利用视觉和文本信息的协同作用在检测任务中日益受到关注,为传统目标检测在 PPE 识别方面的局限性提供了有前景的解决方案。然而,VLMs 在持续验证 PPE 属性方面面临挑战,因为工作场所环境的复杂性和多变性要求它们同时解读上下文特定的语言和视觉线索。我们提出了 Clip2Safety,一个用于多样化工作场所安全合规的可解释检测框架,包含四个主要模块:场景识别、视觉提示、安全物品检测和细粒度验证。场景识别识别当前场景以确定所需的安全装备。视觉提示制定检测过程所需的特定视觉提示。安全物品检测根据指定场景判断所需安全装备是否被佩戴。最后,细粒度验证评估佩戴的安全装备是否满足细粒度属性要求。我们在六个不同场景中进行了真实案例研究。结果表明,Clip2Safety 不仅展示了相对于最先进的基于问答的 VLMs 的准确率提升,而且实现了两百倍更快的推理速度。
引用
@article{arxiv.2408.07146,
title = {Vision Language Model for Interpretable and Fine-grained Detection of Safety Compliance in Diverse Workplaces},
author = {Zhiling Chen and Hanning Chen and Mohsen Imani and Ruimin Chen and Farhad Imani},
journal= {arXiv preprint arXiv:2408.07146},
year = {2024}
}
备注
20 pages, 7 figures