M5 预测竞赛评估设置考察
机器学习
2021-08-10 v1 统计方法学
摘要
预测评估在经验证据如何塑造学科发展方面起着关键作用。领域专家对与其决策需求相关的误差度量感兴趣。此类度量可能产生不可靠结果。尽管若干度量的可靠性性质已被讨论,却鲜有以客观方式量化。我们提出一种名为秩稳定性(Rank Stability)的度量,用于评估在模型与误差恒定情况下,相似数据集间实验的排序差异程度。我们借此研究 M5 的评估设置。我们发现 M5 的评估设置比其他度量更不可靠。不稳定的主要驱动因素是层次聚合与缩放。价格加权降低了所有被测误差度量的稳定性。M5 误差度量的尺度归一化导致比其它无尺度误差更低的稳定性。单独考虑的层次级别随聚合增多更不稳定,而其组合甚至比单独级别更不稳定。我们还展示了在保持聚合重要性的同时不影响稳定性的正向权衡。聚合与稳定性可关联到备受争议的魔数之影响。我们的诸多发现可应用于一般层次预测基准测试。
引用
@article{arxiv.2108.03588,
title = {A Look at the Evaluation Setup of the M5 Forecasting Competition},
author = {Hansika Hewamalage and Pablo Montero-Manso and Christoph Bergmeir and Rob J Hyndman},
journal= {arXiv preprint arXiv:2108.03588},
year = {2021}
}