为何在时间序列预测中模型选择会失败:数据 regime 下不稳定性的实证研究
信号处理
2026-05-05 v1 统计方法学
机器学习
摘要
时间序列预测模型往往在统计和结构属性不同的数据集之间表现不一致。尽管已有多种可用的预测技术,但仍不清楚基于简单数据特征是否可靠指导模型选择。本文通过分析数据特征描述符与模型性能之间的关系,来探讨基于规则的模型选择为何在时间序列预测中失败。我们引入一种基于描述符的框架,用于通过可衡量的属性(包括趋势强度、季节性、噪声水平和时间依赖性)来描述时间序列。基于这些描述符,构建了一种将数据 regime 映射到候选预测模型的基于规则的选择机制。该方法在多个不同领域和预测时滞的数据集上进行评估。结果表明,基于规则的模型选择准确率低下,仅在很小一部分情况下正确识别模型。在噪声和混合 regime 中,推荐模型与实证最优模型之间存在显著差异。进一步分析显示,模型性能对数据集特征和预测时滞高度敏感,导致不同情景下的排名不稳定。这些发现解释了为何简单启发式规则难以概括,并表明预测性能无法通过静态、基于描述符的方法可靠预测。本研究提供了实证证据表明时间序列预测中的模型选择本质上是情境依赖的,并强调需要更具适应性的数据驱动策略。
引用
@article{arxiv.2605.01608,
title = {Why Model Selection Fails in Time Series Forecasting: An Empirical Study of Instability Across Data Regimes},
author = {Tahir Cetin Akinci and Alfredo A. Martinez-Morales},
journal= {arXiv preprint arXiv:2605.01608},
year = {2026}
}