中文

SDIGLM: 利用大型语言模型与多模态思维链进行结构损伤识别

计算机视觉与模式识别 2025-04-17 v1 人工智能

摘要

现有的基于计算机视觉(CV)的结构损伤识别模型在分类和定位损伤方面表现出显著的准确性。然而,这些模型存在几个关键局限性,阻碍了它们在土木工程(CE)中的实际应用。首先,它们识别损伤类型的能力仍然受限,无法全面分析实际CE结构中高度多变和复杂的状况。其次,这些模型缺乏语言能力,无法通过自然语言描述来阐述结构损伤特征。随着人工智能(AI)的不断进步,大型多模态模型(LMMs)已成为一种变革性解决方案,能够实现文本和视觉数据的统一编码和对齐。这些模型可以自主生成结构损伤的详细描述性叙述,同时在各种场景和任务中展现出强大的泛化能力。本研究引入了SDIGLM,一种用于结构损伤识别的创新性LMM,基于开源VisualGLM-6B架构开发。为了解决LMM适应CE中复杂多变操作条件的挑战,本文集成了基于U-Net的语义分割模块,生成缺陷分割图作为视觉思维链(CoT)。此外,构建了一个多轮对话微调数据集以增强逻辑推理,并通过提示工程形成语言CoT。通过利用这种多模态CoT,SDIGLM在结构损伤识别方面超越了通用LMM,在各种基础设施类型上达到了95.24%的准确率。此外,该模型有效地描述了损伤特征,如孔洞尺寸、裂缝方向和腐蚀严重程度。

关键词

引用

@article{arxiv.2504.11477,
  title  = {SDIGLM: Leveraging Large Language Models and Multi-Modal Chain of Thought for Structural Damage Identification},
  author = {Yunkai Zhang and Shiyin Wei and Yong Huang and Yawu Su and Shanshan Lu and Hui Li},
  journal= {arXiv preprint arXiv:2504.11477},
  year   = {2025}
}