中文

MLLM4TS:利用视觉与多模态语言模型进行通用时序分析

机器学习 2025-10-10 v1 人工智能 计算机视觉与模式识别 数据库

摘要

时序数据分析面临显著挑战,由于多变量数据的复杂时序依赖性和跨通道相互作用。我们受人类分析师通过视觉检查时序数据以揭示隐藏模式的启发,提出:是否可以将视觉表征纳入自动化时序分析以提升效果?近期进展表明,多模态大语言模型在泛化和视觉理解方面具有惊人的能力,但其在时序数据的应用仍受限于连续数值数据与离散自然语言之间的模态鸿沟。为弥合这一鸿沟,我们引入MLLM4TS,一种新型框架,利用多模态大语言模型进行通用时序分析,通过集成专门的视觉分支实现。每个时序通道被渲染为水平堆叠的彩色编码线图,以捕获跨通道的空间依赖性,随后采用时序感知的视觉块对齐策略将视觉块与相应时段对齐。MLLM4TS将来自数值数据的细粒度时序细节与来自视觉表征的全局上下文信息融合,为多模态时序分析提供了统一基础。广泛的基准实验表明,MLLM4TS在各种预测任务(如分类)和生成任务(如异常检测和预测)中均表现出色。这些结果凸显了将视觉模态与预训练语言模型集成以实现稳健且可泛化时序分析的潜力。

关键词

引用

@article{arxiv.2510.07513,
  title  = {MLLM4TS: Leveraging Vision and Multimodal Language Models for General Time-Series Analysis},
  author = {Qinghua Liu and Sam Heshmati and Zheda Mai and Zubin Abraham and John Paparrizos and Liu Ren},
  journal= {arXiv preprint arXiv:2510.07513},
  year   = {2025}
}