Time-MoE:基于混合专家的十亿级时间序列基础模型
机器学习
2025-02-28 v4 人工智能
摘要
深度学习在过去数十年间已在时间序列预测领域取得显著进展。然而,尽管大规模预训练在语言和视觉领域取得成功,预训练时间序列模型仍在规模和成本方面受限,阻碍了开发更大有能力的预测模型。为此,我们提出Time-MoE,一种可扩展且统一的架构,旨在预训练更大更有能力的预测基础模型,同时降低推理成本。通过采用稀疏混合专家(MoE)设计,Time-MoE通过为每个预测激活仅部分网络子集来提升计算效率,降低计算负担,同时保持高模型容量。这使得Time-MoE能够在规模提升的同时保持推理成本不增。Time-MoE由一系列仅解码器的变换模型组成,这些模型以自回归方式运行,支持可变输入上下文长度的灵活预测时域。我们在新构建的大规模数据Time-300B上对这些模型进行预训练,该数据集覆盖9个领域,包含超过3000亿个时间点。首次将时间序列基础模型规模提升至24亿参数,实现显著提升的预测精度。我们的实验结果验证了在时间序列预测语境下,对训练标记和模型规模的比例规模定律的适用性。与相同激活参数或等效计算预算的稠密模型相比,我们的模型始终以显著优势表现。这些突破性进展将Time-MoE定位为解决现实世界时间序列预测挑战的前沿解决方案,具备卓越的能力、效率和灵活性。
引用
@article{arxiv.2409.16040,
title = {Time-MoE: Billion-Scale Time Series Foundation Models with Mixture of Experts},
author = {Xiaoming Shi and Shiyu Wang and Yuqi Nie and Dianqi Li and Zhou Ye and Qingsong Wen and Ming Jin},
journal= {arXiv preprint arXiv:2409.16040},
year = {2025}
}
备注
Accepted by the 13th International Conference on Learning Representations (ICLR 2025)