中文

迈向基础时间序列模型:合成与否?

机器学习 2024-03-06 v1

摘要

行业中存在大量需要一次性对大量时间序列进行预测的案例。然而,我们可能处于无法为每个序列训练单独模型的情况。时间序列建模中的这一问题仍未得到应有的关注。针对这种设置的补救措施是建立基础模型。此类模型预计能在零样本和少样本模式下工作。然而,我们应该用什么作为此类模型的训练数据集?鉴于自然语言处理 (NLP) 数据集通过人工生成数据 enriched 而受益,我们可能希望将其经验应用于时间序列。与自然语言相比,合成时间序列数据的生成过程更为有利,因为它提供了对序列模式、时间范围和样本数量的完全控制。在这项工作中,我们考虑了一个基本问题:在合成数据上训练基础模型是否有利,还是最好仅利用有限数量的真实示例。我们的实验仅针对常规时间序列进行,结果支持仅利用真实时间序列。此外,适当源数据集的选择强烈影响推理期间的性能。即使仅提供有限数量的短时间序列数据,在监督框架内使用它也比在更大体积的合成数据上训练产生更有利的结果。我们实验的代码已在 Github 上公开:\url{https://github.com/sb-ai-lab/synthesize_or_not}。

关键词

引用

@article{arxiv.2403.02534,
  title  = {Towards Foundation Time Series Model: To Synthesize Or Not To Synthesize?},
  author = {Kseniia Kuvshinova and Olga Tsymboi and Alina Kostromina and Dmitry Simakov and Elizaveta Kovtun},
  journal= {arXiv preprint arXiv:2403.02534},
  year   = {2024}
}