VisionTS++: 基于持续预训练视觉主干网络的跨模态时间序列基础模型
计算机视觉与模式识别
2025-10-13 v3 机器学习
摘要
最近的研究表明,预训练于图像上的视觉模型可通过将时间序列预测重新表述为图像重建来用作时间序列基础模型(TSFM)。然而,由于存在三个差异,视觉模型向时间序列的有效跨模态迁移仍具有挑战性:(1)结构受限的图像数据与非结构化、异构的时间序列数据之间的模态差距;(2)固定RGB三通道视觉模型与任意数量变量的时间序列之间的多变量预测差距;(3)视觉模型确定性输出与面向不确定性的概率预测之间的概率预测差距。为弥合这些差距,我们提出了VisionTS++,一种基于大规模时间序列持续预训练视觉模型的TSFM。我们的方法引入了三个关键创新:(1)基于视觉模型的过滤,用于识别高质量序列以稳定预训练并缓解模态差距;(2)色彩化的多变量转换,将多变量序列编码为多子图RGB图像,以增强跨变量建模;(3)多分位预测,使用平行重建头生成无参数假设的分位预测。实验表明,VisionTS++在分布内和分布外预测中均实现了时刻最佳性能,相较于专门的TSFM以6%-44%的MSE降低优势,在GIFT-Eval基准中名列前茅,该基准涵盖23个数据集,跨越7个领域。我们的工作表明,经过恰当的适配,视觉模型能够有效地泛化到TSF,从而推动了通用TSFM的 pursuit。代码已公开于 https://github.com/HALF111/VisionTSpp。
引用
@article{arxiv.2508.04379,
title = {VisionTS++: Cross-Modal Time Series Foundation Model with Continual Pre-trained Vision Backbones},
author = {Lefei Shen and Mouxiang Chen and Xu Liu and Han Fu and Xiaoxue Ren and Jianling Sun and Zhuo Li and Chenghao Liu},
journal= {arXiv preprint arXiv:2508.04379},
year = {2025}
}
备注
19 pages