中文

时序预测中的坏标签:基于自监督学习的时间序列标记问题

机器学习 2025-12-17 v4 人工智能

摘要

时序预测是诸多领域中的关键任务,但现有时序预测模型依赖于高质量数据且未充分利用所有可用数据。本文探索一种新颖的自监督方法,通过本构方法内在构建候选数据集来重新标记时序数据集。在简单重建网络的优化过程中,使用中间结果作为伪标签,以自监督范式进行标记,从而提高对任意预测器的泛化能力。我们引入 Self-Correction with Adaptive Mask (SCAM),该方法会丢弃过拟合的组件,并用来自重建的伪标签有选择地替换它们。此外,我们纳入谱范数正则化 (SNR),从损失景观角度进一步抑制过拟合。我们在 11 个真实数据集上进行实验,表明 SCAM 能一致地提高各种主干模型的性能。本工作通过自监督学习提供了一种构建数据集并提升时序预测模型泛化能力的新视角。代码已公开于 https://github.com/SuDIS-ZJU/SCAM。

关键词

引用

@article{arxiv.2502.14704,
  title  = {Not All Data are Good Labels: On the Self-supervised Labeling for Time Series Forecasting},
  author = {Yuxuan Yang and Dalin Zhang and Yuxuan Liang and Hua Lu and Gang Chen and Huan Li},
  journal= {arXiv preprint arXiv:2502.14704},
  year   = {2025}
}

备注

Accepted by NeurIPS'25 (spotlight)