大规模多模态预训练:赋能时间序列分析
机器学习
2026-02-06 v1
摘要
虽然现有时间序列基础模型主要依赖大规模单模态预训练,但缺乏补充模态来增强时间序列理解。构建多模态基础模型是自然的下一步,但面临两个关键挑战:1) 缺乏统一的多模态预训练范式和大规模多模态语料库用于时间序列分析;2) 如何有效整合异构模态并提升模型泛化能力。为此,我们在时间序列分析领域走出了多模态基础模型的第一步。我们首先提出一种多模态预训练范式,利用时间序列的内生模态(派生图像和文本)和外生知识(真实新闻),为时间序列分析提供全面的多视角视角。为支持这一目标,我们开发了一个自动化的数据构建管道,以构建 MM-TS——第一个跨越六个领域、规模可达数十亿数据的大规模多模态时间序列数据集。随后我们提出 HORAI,一个基于频率增强的多模态基础模型。它集成了两个核心组件:频率增强的跨模态编码器和时频解码器,旨在有效融合多模态特征并提升模型在不同模态和领域之间的泛化能力。在MM-TS上进行预训练后,HORAI在时间序列预测和异常检测任务上实现了零样本性能的突破,显示出强大的泛化能力。
引用
@article{arxiv.2602.05646,
title = {Empowering Time Series Analysis with Large-Scale Multimodal Pretraining},
author = {Peng Chen and Siyuan Wang and Shiyan Hu and Xingjian Wu and Yang Shu and Zhongwen Rao and Meng Wang and Yijie Li and Bin Yang and Chenjuan Guo},
journal= {arXiv preprint arXiv:2602.05646},
year = {2026}
}