GIFT-Eval:通用时间序列预测模型评估基准
机器学习
2024-11-12 v2 机器学习
摘要
时间序列基础模型在零样预测中表现出色,能够在无需显式训练的情况下处理多样化任务。然而,由于缺乏全面的基准测试,这些模型的发展受到阻碍。为解决这一问题,我们介绍了通用时间序列预测模型评估基准,GIFT-Eval,这是一个旨在促进跨数据集评估的先驱性基准。GIFT-Eval涵盖23个数据集,包含超过144,000个时间序列和1.77亿个数据点,涵盖七个领域、10种频率、多变量输入,以及从短期到长期预测的各种预测长度。为有效进行预训练和评估,还提供了一个包含约2300亿个数据点的非泄露预训练数据集。此外,我们提供了17个基线模型的全面分析,包括统计模型、深度学习模型和基础模型。我们讨论每个模型在各种基准特征的背景下,并提供横跨深度学习和基础模型的定性分析。我们相信,这些分析见解以及对这项新型零样时间序列预测基准的访问,将指导未来在时间序列基础模型方面的发展。代码、数据和排行榜可在https://github.com/SalesforceAIResearch/gift-eval 查找。
引用
@article{arxiv.2410.10393,
title = {GIFT-Eval: A Benchmark For General Time Series Forecasting Model Evaluation},
author = {Taha Aksu and Gerald Woo and Juncheng Liu and Xu Liu and Chenghao Liu and Silvio Savarese and Caiming Xiong and Doyen Sahoo},
journal= {arXiv preprint arXiv:2410.10393},
year = {2024}
}