中文

Transformer 为何无法对时间序列进行上下文预测?

机器学习 2025-10-14 v1 人工智能 机器学习

摘要

时间序列预测(TSF)仍是机器学习中一项极具挑战性且基本未解决的问题,尽管近年来大量研究借助以 Transformer 架构为主的大型语言模型(LLMs)进行了诸多尝试。实证证据一致表明,即便强大的 Transformer 在 TSF 任务上也常常无法胜过简单得多的模型(例如线性模型);然而,对这一现象的严格理论理解仍然有限。本文通过上下文学习(ICL)理论的视角,对 Transformer 在 TSF 中的局限性进行了理论分析。具体而言,在 AR(pp) 数据下,我们证明了:(1) 线性自注意力(LSA)模型在上下文预测中 无法\textit{无法} 取得低于经典线性模型的期望均方误差;(2) 当上下文长度趋于无穷时,LSA 渐近地恢复出最优线性预测器;(3) 在思维链(CoT)式推理下,预测结果以指数速率坍缩至均值。我们通过精心设计的实验对这些结论进行了实证验证。本文的理论不仅揭示了若干此前未被充分探讨的现象,也为设计更有效的预测架构提供了实践启示。我们希望本工作能够激励更广泛的研究社区重新审视 TSF 的根本性理论局限,并批判性地评估日益复杂的架构在缺乏深入审视的情况下被直接应用的做法。

关键词

引用

@article{arxiv.2510.09776,
  title  = {Why Do Transformers Fail to Forecast Time Series In-Context?},
  author = {Yufa Zhou and Yixiao Wang and Surbhi Goel and Anru R. Zhang},
  journal= {arXiv preprint arXiv:2510.09776},
  year   = {2025}
}

备注

Code: https://github.com/MasterZhou1/ICL-Time-Series