中文

在 CloudOps 领域推动时间序列预测预训练的极限

机器学习 2023-12-06 v3

摘要

在时间序列领域,预训练与迁移学习的浪潮已然落后。尽管自然语言处理和计算机视觉领域的研究正享用着愈发庞大的数据集来训练海量模型,但最流行的时间序列数据集仅包含数万时间步,限制了我们研究预训练与规模化的有效性。近期研究也对表达性模型与规模化的必要性提出质疑。为缓解这些问题,我们引入了三个来自云运维(CloudOps)领域的大规模时间序列预测数据集,其中最大的包含数十亿条观测值,从而能够进一步研究时间序列模型的预训练与规模化。我们为研究时间序列模型的预训练与规模化奠定了实证基础,并通过确定一个大有前景的候选架构为未来研究铺平道路。我们表明,它是一个强大的零样本基线,并且受益于进一步的规模化,无论是在模型还是数据集规模上。伴随这些数据集与结果的是一套综合基准结果,将经典与深度学习基线与我们的预训练方法进行比较——在最大数据集上实现了 27% 的误差降低。代码与数据集可在 https://github.com/SalesforceAIResearch/pretrain-time-series-cloudops 找到。

关键词

引用

@article{arxiv.2310.05063,
  title  = {Pushing the Limits of Pre-training for Time Series Forecasting in the CloudOps Domain},
  author = {Gerald Woo and Chenghao Liu and Akshat Kumar and Doyen Sahoo},
  journal= {arXiv preprint arXiv:2310.05063},
  year   = {2023}
}