从数值到词元:基于LLM驱动与符号离散化的上下文感知时间序列预测框架
机器学习
2025-08-14 v1 人工智能
摘要
时间序列预测在支持能源、医疗保健和金融等广泛关键应用的决策制定中发挥着重要作用。尽管近期取得了进展,但由于难以将历史数值序列与通常包含非结构化文本数据的上下文特征相整合,预测精度仍然受限。为应对这一挑战,我们提出了TokenCast,一个由LLM驱动的框架,利用基于语言的符号表示作为统一中介,进行上下文感知的时间序列预测。具体而言,TokenCast采用离散分词器将连续数值序列转化为时间词元,实现与基于语言输入的结构对齐。为弥合模态间的语义鸿沟,时间词元和上下文词元通过预训练的大语言模型(LLM)被嵌入到共享表示空间中,并进一步通过自回归生成目标进行优化。基于这一统一语义空间,对齐后的LLM随后以监督方式进行微调,以预测未来的时间词元,再将其解码回原始数值空间。在富含上下文特征的多样化真实世界数据集上的广泛实验证明了TokenCast的有效性和泛化能力。
引用
@article{arxiv.2508.09191,
title = {From Values to Tokens: An LLM-Driven Framework for Context-aware Time Series Forecasting via Symbolic Discretization},
author = {Xiaoyu Tao and Shilong Zhang and Mingyue Cheng and Daoyu Wang and Tingyue Pan and Bokai Pan and Changqing Zhang and Shijin Wang},
journal= {arXiv preprint arXiv:2508.09191},
year = {2025}
}