中文

长期序列预测是否需要复杂注意力与超长输入?

机器学习 2024-02-06 v3

摘要

随着基于 Transformer 的模型在各种时间序列任务上取得令人印象深刻的性能,长期序列预测(LTSF)任务近年来也受到广泛关注。然而,由于基于 Transformer 的方法固有的计算复杂度和对长序列的需求,其在 LTSF 任务上的应用仍存在两个有待进一步研究的主要问题:1)这些方法设计的稀疏注意力机制是否真正降低了真实设备上的运行时间;2)这些模型是否需要超长的输入序列来保证其性能?本文给出的答案是否定的。因此,为更好地应对这两个问题,我们设计了一种轻量的周期注意力机制(Periodformer),其通过显式周期性重构长期子序列的聚合,并通过内置邻近性重构短期子序列的聚合。同时,一个门控机制被嵌入 Periodformer 以调节注意力模块对预测结果的影响。此外,为充分利用 GPU 进行快速超参数优化(如寻找合适输入长度),提出了一种基于贝叶斯优化的多 GPU 异步并行算法(MABO)。MABO 通过队列机制为每个 GPU 分配一个进程,并一次创建多个试验以进行异步并行搜索,大幅减少了搜索时间。与最先进(SOTA)方法相比,Periodformer 的预测误差在多变量和单变量预测上分别降低了 13% 和 26%。此外,MABO 在找到更优超参数的同时,将平均搜索时间减少了 46%。综上,本文指出 LTSF 可能不需要复杂注意力与超长输入序列。代码已在 Github 上开源。

关键词

引用

@article{arxiv.2306.05035,
  title  = {Does Long-Term Series Forecasting Need Complex Attention and Extra Long Inputs?},
  author = {Daojun Liang and Haixia Zhang and Dongfeng Yuan and Xiaoyan Ma and Dongyang Li and Minggao Zhang},
  journal= {arXiv preprint arXiv:2306.05035},
  year   = {2024}
}

备注

Under Review