中文

FaultGPT:基于视觉语言模型的工业故障诊断问答系统

新兴技术 2025-02-24 v1 信号处理

摘要

近期,利用基于机械振动信号的单模态大语言模型作为调谐预测器为智能故障诊断引入了新视角。然而,这些方法利用多模态数据的潜力尚未得到充分开发,特别是在复杂的机械系统中,依赖单一数据源往往无法捕捉全面的故障信息。在本文中,我们提出了FaultGPT,一种直接从原始振动信号生成故障诊断报告的模型。通过利用大型视觉语言模型和文本监督,FaultGPT执行端到端的故障诊断问答,区别于传统的分类或回归方法。具体而言,我们构建了一个大规模的故障诊断问答指令数据集用于视觉语言模型的指令微调。该数据集包括振动时频图像-文本标签对以及人类指令-真实标签对。为了增强生成高质量故障诊断报告的能力,我们设计了一个多尺度跨模态图像解码器以提取细粒度的故障语义,并在不引入额外训练参数到视觉语言模型的情况下进行了指令微调。广泛的实验,包括故障诊断报告生成、多数据集上的少样本和零样本评估,验证了FaultGPT在多样化工业场景中的优越性能和适应性。

关键词

引用

@article{arxiv.2502.15481,
  title  = {FaultGPT: Industrial Fault Diagnosis Question Answering System by Vision Language Models},
  author = {Jiao Chen and Ruyi Huang and Zuohong Lv and Jianhua Tang and Weihua Li},
  journal= {arXiv preprint arXiv:2502.15481},
  year   = {2025}
}