从提示到防护:多模态 LLM 在建筑安全风险识别中的比较研究
计算机视觉与模式识别
2026-05-12 v1 人工智能
新兴技术
摘要
近期多模态大型语言模型(LLM)的出现为提高建筑工地的视觉风险识别带来了新机遇。不同于依赖领域特定训练和大量数据集的传统计算机视觉模型,现代 LLM 可通过简单自然语言提示来解读和描述复杂的视觉场景。然而,尽管对其应用日益关注,但关于不同 LLM 在建筑领域安全关键视觉任务中性能的探讨仍有限。为填补这一空白,本研究对五种最先进的 LLM(Claude-3 Opus、GPT-4.5、GPT-4o、GPT-o3 和 Gemini 2.0 Pro)进行了比较评估,以评估其从真实建筑图像中识别潜在风险的能力。每个模型在三种提示策略下进行测试:零样本提示、少样本提示和链式思维(CoT)提示。零样本提示仅提供最小指令,少样本提示包含基本安全上下文和风险来源记忆符号,CoT 提供逐步推理示例以引导模型思考。我们对所有条件下的模型进行量化分析,采用精确率、召回率和 F1 分数等指标进行评估。结果表明,提示策略对性能影响显著,CoT 提示在所有模型中均一致产生更高的准确率。此外,模型在不同条件下的表现存在差异,GPT-4.5 和 GPT-o3 在大多数设置下表现优异。研究还表明,提示设计在提升多模态 LLM 在建筑安全应用中的准确率和一致性方面发挥着关键作用。本研究为在实际风险识别中集成提示工程与 LLM 提供了可操作性见解,助力开发更可靠的人工智能安全系统。
引用
@article{arxiv.2506.07436,
title = {Prompt to Protection: A Comparative Study of Multimodal LLMs in Construction Hazard Recognition},
author = {Nishi Chaudhary and S M Jamil Uddin and Sathvik Sharath Chandra and Anto Ovid and Alex Albert},
journal= {arXiv preprint arXiv:2506.07436},
year = {2026}
}