中文

参数高效的深度概率预测

机器学习 2021-12-15 v2

摘要

概率时间序列预测在零售、电商、金融或生物等许多应用领域至关重要。随着大量数据日益可用,针对该问题已提出若干神经架构。特别是,基于 Transformer 的方法在真实世界基准上取得了最先进的性能。然而,这些方法需要学习大量参数,从而对训练此类模型的计算资源提出了高内存需求。为解决该问题,我们引入一种新颖的双向时间卷积网络(BiTCN),其所需参数比常见的基于 Transformer 的方法少一个数量级。我们的模型结合了两个时间卷积网络(TCN):第一个网络编码时间序列的未来协变量,而第二个网络编码过去的观测值与协变量。我们通过这两个网络联合估计输出分布的参数。在四个真实世界数据集上的实验表明,在多数情况下,我们的方法在两点度量(sMAPE、NRMSE)以及一组区间度量(分位数损失百分位数)上与四种最先进的概率预测方法(包括一种基于 Transformer 的方法和 WaveNet)表现相当。其次,我们证明我们的方法比基于 Transformer 的方法所需参数显著更少,这意味着模型可更快训练且内存需求大幅降低,从而降低部署这些模型的基础设施成本。

关键词

引用

@article{arxiv.2112.02905,
  title  = {Parameter Efficient Deep Probabilistic Forecasting},
  author = {Olivier Sprangers and Sebastian Schelter and Maarten de Rijke},
  journal= {arXiv preprint arXiv:2112.02905},
  year   = {2021}
}

备注

Accepted as journal paper to the International Journal of Forecasting