结合目标检测与小规模视觉语言模型进行施工安全风险识别
计算机视觉与模式识别
2026-04-08 v1
摘要
准确及时地识别工人周围施工风险对于预防工作场所事故至关重要。虽然大型视觉语言模型(VLM)展现出强大的上下文推理能力,但其高计算需求限制了其在近实时施工风险检测中的应用。相比之下,参数少于40亿的小型视觉语言模型(sVLM)效率更高,但在分析复杂施工场景时往往因准确率和幻觉问题而受限。为解决这一权衡,本研究提出了一种检测引导的sVLM框架,将目标检测与多模态推理相结合,用于上下文相关的风险识别。该框架首先使用YOLOv11n检测器对场景中的工人和施工机械进行定位。随后将检测到的实体嵌入结构化提示中,引导sVLM的推理过程,实现空间定位的风险评估。在该框架下,六种sVLM(Gemma-3 4B、Qwen-3-VL 2B/4B、InternVL-3 1B/2B和SmolVLM-2B)在零样本设置下,于经过精心整理的施工现场图像数据集(包含风险标注和解释性理由)上进行了评估。所提出的方法在所有模型上持续提升了风险检测性能。表现最佳的模型Gemma-3 4B实现了50.6%的F1分数,而基线配置为34.5%。解释质量也显著提升,BERTScore F1从0.61提高到0.82。尽管引入了目标检测,该框架引入的开销极小,推理时每张图像仅增加2.5毫秒。这些结果表明,将轻量级目标检测与小VLM推理相结合,为上下文感知的施工安全风险检测提供了一种有效且高效的解决方案。
引用
@article{arxiv.2604.05210,
title = {Integration of Object Detection and Small VLMs for Construction Safety Hazard Identification},
author = {Muhammad Adil and Mehmood Ahmed and Muhammad Aqib and Vicente A. Gonzalez and Gaang Lee and Qipei Mei},
journal= {arXiv preprint arXiv:2604.05210},
year = {2026}
}