增强Transformer在时间序列预测中的局部性并打破其内存瓶颈
机器学习
2020-01-06 v3 机器学习
摘要
时间序列预测是许多领域中的重要问题,包括太阳能电厂输出功率、电力消耗和交通拥堵状况的预测。在本文中,我们提出用Transformer [1] 来解决此类预测问题。尽管在初步研究中其性能令人印象深刻,但我们发现其两个主要弱点:(1)局部性不敏感:标准Transformer架构中逐点点积自注意力对局部上下文不敏感,这使得模型易受时间序列中异常值的影响;(2)内存瓶颈:标准Transformer的空间复杂度随序列长度L呈二次增长,使得直接对长时间序列建模不可行。为解决这两个问题,我们首先提出卷积自注意力,通过因果卷积生成查询和键,从而将局部上下文更好地融入注意力机制。然后,我们提出LogSparse Transformer,其内存开销仅为O(L(log L)²),在受限内存预算下提升了具有细粒度和强长期依赖的时间序列的预测精度。我们在合成数据和真实世界数据集上的实验表明,它与最先进方法相比具有优势。
引用
@article{arxiv.1907.00235,
title = {Enhancing the Locality and Breaking the Memory Bottleneck of Transformer on Time Series Forecasting},
author = {Shiyang Li and Xiaoyong Jin and Yao Xuan and Xiyou Zhou and Wenhu Chen and Yu-Xiang Wang and Xifeng Yan},
journal= {arXiv preprint arXiv:1907.00235},
year = {2020}
}
备注
To appear in the proceeding of NeurIPS 2019