中文

时间的语言:时间序列基础模型视角

机器学习 2025-07-02 v1 人工智能 计算与语言

摘要

随着大型语言模型的兴起,训练拥有大量参数的基础模型在广大数据集上进行的范式已被采用于多个领域,取得了显著成功。时间序列基础模型是这一范式的重要延伸,展现出卓越的表达力、泛化能力和跨域迁移能力。然而,这又引出一个根本性的悖论:时间序列数据反映不同的动力系统,使得跨域迁移直观上难以实现,却与模型的实证成功相矛盾。为解决这一悖论,本文从理论和实验两个角度 investigates 时间序列基础模型的表示学习机制和泛化能力。我们认为,这类模型不仅仅是在施行新的架构,而是通过将确定性向量表示扩展至潜在概率分布形式,从根本上泛化了语言模型的表示范式。我们的理论分析支持这一框架,表明连续时间序列片段可以被忠实量化为离散词汇表,其关键统计特性与自然语言高度一致。这一泛化使时间序列模型能够继承大型语言模型的稳健表示和迁移能力,从而解释了其在时序任务中的优异性能。最终,我们的工作为理解、评估和改进大规模时间序列基础模型的安全性和可靠性提供了严谨的理论基础。

关键词

引用

@article{arxiv.2507.00078,
  title  = {The language of time: a language model perspective on time-series foundation models},
  author = {Yi Xie and Yun Xiong and Zejian Shi and Hao Niu and Zhengfu Liu},
  journal= {arXiv preprint arXiv:2507.00078},
  year   = {2025}
}