面向工业时序大数据分析的多模态大语言模型框架——TS-MLLM
机器学习
2026-03-10 v1
摘要
对工业时序大数据的精准分析对于设备的预估诊断与健康管理(PHM)至关重要。虽然近期的大型语言模型(LLM)在时序分析方面显示出前景,但现有方法通常专注于单模态适配,无法发挥时序信号、频域视觉表征和文本知识信息的互补性。本文提出TS-MLLM,一个统一的多模态大语言模型框架,用于联合建模时序信号、频域图像和文本领域知识。具体而言,我们首先开发了工业时序 Patch 模型分支,以捕获长程时序动力学。为集成跨模态先验,本文引入了谱感知视觉-语言模型适应(SVLMA)机制,使模型能够内化频域模式和语义上下文。进一步设计了以时序特征为查询检索相关视觉和文本线索的时序中心多模态注意力融合(TMAF)机制,确保深度跨模态对齐。多个工业基准上的大量实验表明,TS-MLLM 在 few-shot 和复杂场景中显著优于最新方法,验证了该框架在工业时序预测中的卓越鲁棒性、效率和泛化能力。
引用
@article{arxiv.2603.07572,
title = {TS-MLLM: A Multi-Modal Large Language Model-based Framework for Industrial Time-Series Big Data Analysis},
author = {Haiteng Wang and Yikang Li and Yunfei Zhu and Jingheng Yan and Lei Ren and Laurence T. Yang},
journal= {arXiv preprint arXiv:2603.07572},
year = {2026}
}