离散化在预测中的有效性:对神经时间序列模型的实证研究
机器学习
2020-05-21 v1 机器学习
摘要
近年来,基于深度学习的时序建模技术取得了诸多进展,尤其是在数据丰富的场景下,其核心目标是学习能够从多个时间序列中提取模式的全局模型。尽管先前工作经常强调适当的数据预处理与缩放至关重要,但多数研究聚焦于改进模型架构。本文通过实证考察数据输入与输出变换对若干神经预测架构预测性能的影响。具体而言,我们研究了多种形式的数据分箱(即将实值时间序列转换为类别型序列)与前馈网络、循环神经网络以及基于卷积的序列模型结合时的有效性。在这些模型取得巨大成功的许多非预测应用中,模型输入与输出均为类别型(例如自然语言处理应用中的固定词表单词,或计算机视觉中的量化像素颜色强度)。对于预测应用,时间序列通常为实值,虽已提出各种临时数据变换,但缺乏系统比较。为弥补此不足,我们评估了上述模型类别在不同类型数据缩放与分箱组合下的预测精度。我们发现分箱几乎总能提升性能(相较于使用归一化实值输入),但所选分箱的具体类型影响较小。
引用
@article{arxiv.2005.10111,
title = {The Effectiveness of Discretization in Forecasting: An Empirical Study on Neural Time Series Models},
author = {Stephan Rabanser and Tim Januschowski and Valentin Flunkert and David Salinas and Jan Gasthaus},
journal= {arXiv preprint arXiv:2005.10111},
year = {2020}
}