时间序列预测中的隐藏泄漏:数据泄漏如何影响LSTM在不同配置和验证策略下的评估
机器学习
2025-12-09 v1 人工智能
摘要
深度学习模型,特别是长短期记忆(LSTM)网络,因其捕捉复杂时序依赖能力,广泛应用于时间序列预测。然而,评估的完整性常因数据泄漏而受到损害,这是一种方法论缺陷,即在数据划分前构造输入输出序列,导致未来信息不可意外地影响训练过程。本文聚焦数据泄漏对性能的影响,重点考察验证设计如何调节泄漏敏感性。评估了三种广泛使用的验证技术(2向划分、3向划分和10折交叉验证),在漏洞(预划分序列生成)与干净(通过在数据划分前强制时间分离来缓解泄漏风险)两种条件下进行比较。通过计算RMSE增益(RMSE Gain),即由漏洞情况与干净情况之间的RMSE百分比差异所得,评估了泄漏效应。经验结果表明,10折交叉验证在延长滞后步骤时,RMSE增益可达高达20.5%;相比之下,2向划分和3向划分通常在不同配置下保持RMSE增益低于5%。此外,输入窗口大小和滞后步骤显著影响泄漏敏感性:较小的窗口和较长的滞后会增加泄漏风险,而较大的窗口则有助于降低其风险。这些发现凸显了需建立面向配置感知、抗泄漏评估流水线的必要性,以确保可靠的性能估计。
引用
@article{arxiv.2512.06932,
title = {Hidden Leaks in Time Series Forecasting: How Data Leakage Affects LSTM Evaluation Across Configurations and Validation Strategies},
author = {Salma Albelali and Moataz Ahmed},
journal= {arXiv preprint arXiv:2512.06932},
year = {2025}
}