基于多模态视觉语言RAG框架的建筑安全检查自动化
计算机视觉与模式识别
2025-10-07 v1 计算与语言
信息检索
摘要
传统建筑安全检查方法常常效率低下,需处理大量信息。近期大型视觉语言模型(LVLMs)的进展为通过增强视觉和语言理解自动化安全检查提供了机会。然而,现有应用面临以下限制:返回不相关或不够具体的响应、受限的模态输入以及幻觉现象。将大型语言模型(LLM)用于此目的受限于训练数据的可用性,常缺乏实时适应性。本研究引入SiteShield,一种基于多模态LVLMs的检索增强生成(RAG)框架,用于自动化建筑安全检查报告,通过整合视觉和音频输入。使用真实数据,SiteShield在无RAG的单模态LLM之上取得了F1分数0.82、hamming loss 0.04、精确率0.76和召回率0.96的更好性能。我们的发现表明,SiteShield为增强信息检索和生成安全报告的效率提供了一条新途径。
引用
@article{arxiv.2510.04145,
title = {Automating construction safety inspections using a multi-modal vision-language RAG framework},
author = {Chenxin Wang and Elyas Asadi Shamsabadi and Zhaohui Chen and Luming Shen and Alireza Ahmadian Fard Fini and Daniel Dias-da-Costa},
journal= {arXiv preprint arXiv:2510.04145},
year = {2025}
}
备注
33 pages, 11 figures, 7 tables