大型预训练视觉语言模型是否是有效的建筑安全检查员?
计算机视觉与模式识别
2026-05-28 v2
摘要
建筑安全检查通常涉及人类检查员现场识别安全问题。随着强大视觉语言模型(VLM)的兴起,研究人员正探索其用于从现场图像中检测安全违规的任务。然而,缺乏开放数据集来全面评估和进一步微调VLM以适用于建筑安全检查。当前VLM的应用使用小型监督数据集,限制了其在非直接训练任务中的适用性。本文提出了ConstructionSite 10k 数据集,包含10,000张建筑工地图像,标注涵盖三个相互关联的任务:图像描述生成、安全违规视觉问答(VQA)和施工元素视觉定位。随后我们评估了当前最先进的大型预训练VLM,发现其在零样本和少样本设置中表现出显著的泛化能力,但仍需额外训练以适用于实际建筑工地。该数据集允许研究人员使用新型架构和技术训练和评估自己的VLM,为建筑安全检查提供了宝贵的基准。
引用
@article{arxiv.2508.11011,
title = {Are Large Pre-trained Vision Language Models Effective Construction Safety Inspectors?},
author = {Xuezheng Chen and Zhengbo Zou},
journal= {arXiv preprint arXiv:2508.11011},
year = {2026}
}