中文

VIFO:基于视觉特征的多变量时间序列预测 with 跨模态融合

机器学习 2025-10-07 v1 人工智能 计算机视觉与模式识别

摘要

大型时间序列基础模型通常采用通道独立架构来处理不同的数据维度,但该设计忽略了关键的跨通道依赖关系。同时,现有多模态方法未充分利用大型视觉模型(LVM)来解释时空数据。此外,充分挖掘不同模态信息提取优势以提升时间序列预测性能仍存显著未被探索的潜力。为解决这些问题,我们提出了 VIFO,一种跨模态预测模型。VIFO 独特地将多变量时间序列渲染为图像,使预训练的 LVM 能够提取通道独立模型难以捕获的复杂跨通道模式。这些视觉特征随后与时间序列模态的表示进行对齐和融合。通过冻结 LVM 并仅训练其 7.45% 的参数,VIFO 在多个基准上实现了竞争性能,为捕捉跨变量关系提供了一种高效且有效的解决方案。

关键词

引用

@article{arxiv.2510.03244,
  title  = {VIFO: Visual Feature Empowered Multivariate Time Series Forecasting with Cross-Modal Fusion},
  author = {Yanlong Wang and Hang Yu and Jian Xu and Fei Ma and Hongkang Zhang and Tongtong Feng and Zijian Zhang and Shao-Lun Huang and Danny Dongning Sun and Xiao-Ping Zhang},
  journal= {arXiv preprint arXiv:2510.03244},
  year   = {2025}
}