中文

ChronoSteer:通过合成数据桥接大语言模型与时间序列基础模型

机器学习 2025-05-16 v1

摘要

传统预测方法依赖单一时间序列数据,限制了其利用丰富文本信息的能力。最近,大语言模型(LLMs)和时间序列基础模型(TSFMs)分别在文本推理和时序建模方面展现出强大的能力。将两者的优势整合以构建一种同时利用时序和文本信息进行未来推断的多模态模型,已成为关键的研究挑战。为解决事件-时间序列配对数据稀缺的问题,我们提出了一种解耦框架:采用 LLM 将文本事件转化为修订指令,然后用于引导 TSFM 的输出。为实现该框架,我们引入 ChronoSteer,一种可通过文本修订指令引导的多模态 TSFM,有效地将 LLM 和 TSFM 桥接在一起。此外,为缓解跨模态指令-时间序列配对数据的不足,我们基于合成数据设计了两阶段训练策略。我们还构建了一个高质量的多模态时间序列预测基准数据集,以解决评估期间的信息泄漏问题。经过与 LLM 集成后,仅使用合成数据训练的 ChronoSteer 在预测准确率上较单一模型 backbone 提升了 25.7%,较以往最先进的多模态方法提升了 22.5%。

关键词

引用

@article{arxiv.2505.10083,
  title  = {ChronoSteer: Bridging Large Language Model and Time Series Foundation Model via Synthetic Data},
  author = {Chengsen Wang and Qi Qi and Zhongwen Rao and Lujia Pan and Jingyu Wang and Jianxin Liao},
  journal= {arXiv preprint arXiv:2505.10083},
  year   = {2025}
}