建筑工地风险识别的大模型检索增强框架
人工智能
2025-11-11 v2
摘要
本研究提出一种检索增强框架,用于增强大语言模型(LLM)在建筑工地风险识别中的表现,无需微调。当前 LLM 方法存在局限:图像-文本匹配难以处理复杂风险,指令调优缺乏泛化性且资源密集。我们的方法通过提示调优动态整合外部知识和检索到的类似案例,克服 LLM 在领域知识和特征相关性方面的局限。该框架由案例数据库、图像检索模块和基于 LLM 的推理模块组成。经真实场景数据评估,我们的方法将 GLM-4V 的准确率提升至 50%,相较于基线提升 35.49%,在各种风险类型上均表现出一致的提升。消融研究验证了图像检索策略的有效性,显示 LPIPS 和 CLIP 方法的优越性。该技术显著提升了识别准确率和上下文理解能力,展现出强大的泛化能力,为建筑智能安全风险检测提供了实用路径。
引用
@article{arxiv.2508.02073,
title = {Large model retrieval enhancement framework for construction site risk identification},
author = {Jiawei Li and Chengye Yang and Yaochen Zhang and Weilin Sun and Lei Meng and Xiangxu Meng},
journal= {arXiv preprint arXiv:2508.02073},
year = {2025}
}
备注
in Chinese language