教会时间序列‘看’与‘说’:基于对齐视觉与文本视角的预测
机器学习
2025-07-02 v2 计算机视觉与模式识别
摘要
时间序列预测传统上依赖单模态数值输入,这些输入往往难以捕获其稠密且非结构化性质所带来的高层语义模式。虽然近期方法尝试将时间序列表示为文本(使用大型语言模型LLM),但这些方法仍受限于离散令牌序列的稀疏性,缺乏人类通常应用的感知直觉(如解释视觉模式)。本文提出一种多模态对比学习框架,将原始时间序列转化为结构化的视觉与文本视角。我们不采用自然语言或真实世界图像,而是直接从数值序列构建两种模态。随后通过对比学习将这些视角在共享语义空间中对齐,从而实现更丰富、更互补的表征。进一步,我们引入一个变量选择模块,利用对齐的表征识别多变量预测中最具信息量的变量。广泛的十五组短期和六组长期预测基准测试表明,我们的方法在所有强于单模态和跨模态基线的预测任务中均表现出色,凸显了多模态对齐在增强时间序列预测方面的有效性。代码已公开:https://github.com/Ironieser/TimesCLIP。
引用
@article{arxiv.2506.24124,
title = {Teaching Time Series to See and Speak: Forecasting with Aligned Visual and Textual Perspectives},
author = {Sixun Dong and Wei Fan and Teresa Wu and Yanjie Fu},
journal= {arXiv preprint arXiv:2506.24124},
year = {2025}
}
备注
Code: https://github.com/Ironieser/TimesCLIP