中文

架构之力:深度解析长期时间序列预测中的 Transformer 架构

机器学习 2025-07-18 v1

摘要

Transformer 模型近期在长期时间序列预测(LTSF)中取得主导地位,但其架构变体(如仅编码器、编码器-解码器及仅解码器结构)引发关键问题:哪种 Transformer 架构最适用于 LTSF 任务?然而,现有模型常与多种时间序列特定设计紧密耦合,难以孳立评估架构本身的影响。为此,我们提出一种新型分类法,将这些设计解耦,实现更清晰且统一的架构比较。我们的分类法考量注意力机制、预测聚合、预测范式及归一化层等关键方面。通过大量实验,我们发现若干关键洞见:双向注意力搭配联合注意力最为有效;更完善的预测聚合可提升性能;直接映射范式优于自回归方法。此外,我们的组合模型采用最优架构选择,持续超越多个现有模型,强化了结论的有效性。我们希望这些发现为未来 LTSF 领域的 Transformer 架构设计提供宝贵指导。我们的代码已公开于 https://github.com/HALF111/TSF_architecture。

关键词

引用

@article{arxiv.2507.13043,
  title  = {The Power of Architecture: Deep Dive into Transformer Architectures for Long-Term Time Series Forecasting},
  author = {Lefei Shen and Mouxiang Chen and Han Fu and Xiaoxue Ren and Xiaoyun Joy Wang and Jianling Sun and Zhuo Li and Chenghao Liu},
  journal= {arXiv preprint arXiv:2507.13043},
  year   = {2025}
}

备注

15 pages, 6 figures