时间序列值得用64个词:基于Transformer的长期预测
机器学习
2023-03-07 v2 人工智能
摘要
我们提出了一种高效的基于Transformer的多变量时间序列预测与自监督表示学习模型设计。它基于两个关键组件:(i)将时间序列分割为子序列级片段(patch),作为Transformer的输入token;(ii)通道独立,其中每个通道包含单个单变量时间序列,并在所有序列间共享相同的嵌入和Transformer权重。分片设计天然具有三重好处:局部语义信息保留在嵌入中;在给定相同回看窗口下,注意力图的计算与内存使用呈二次方减少;模型可关注更长的历史。我们的通道独立分片时间序列Transformer(PatchTST)与SOTA基于Transformer的模型相比,能显著提升长期预测精度。我们还将模型应用于自监督预训练任务,获得了优异的微调性能,在大数据集上优于监督训练。在一个数据集上迁移掩码预训练表示到其他数据集也产生了SOTA预测精度。代码见:https://github.com/yuqinie98/PatchTST。
引用
@article{arxiv.2211.14730,
title = {A Time Series is Worth 64 Words: Long-term Forecasting with Transformers},
author = {Yuqi Nie and Nam H. Nguyen and Phanwadee Sinthong and Jayant Kalagnanam},
journal= {arXiv preprint arXiv:2211.14730},
year = {2023}
}
备注
Accepted by ICLR 2023