中文

输出缩放:大型预训练时间序列预测模型中的 YingLong-延迟思维链

机器学习 2025-06-16 v1 人工智能

摘要

我们提出了一个用于时间序列预测的联合预测框架,与传统的直接或递归方法形成对比。该框架为我们设计的基础模型 YingLong 实现了最先进的性能,并揭示了一种新颖的缩放效应:在我们的非因果方法中,由于延迟的思维链推理,更长的输出显著提高了模型准确性。YingLong 是一个非因果的双向注意力纯编码器 Transformer,通过掩码令牌恢复进行训练,与生成任务相比,它能更有效地与语言理解任务对齐。此外,我们通过多输入集成解决输出方差问题,从而提升性能。我们发布了参数量从 6M 到 300M 的四个基础模型,在 ETT 和 Weather 数据集的零样本任务中展示了优异的结果。YingLong 实现了超过 60% 的最佳性能。为确保泛化性,我们使用 GIFT-Eval 基准评估了这些模型,该基准包含跨越 7 个领域的 23 个时间序列数据集。YingLong 在排名上分别比最佳的时间序列基础模型和端到端训练模型高出 14% 和 44%。预训练的 300M 模型可在 https://huggingface.co/qcw1314/YingLong_300m 获取。

关键词

引用

@article{arxiv.2506.11029,
  title  = {Output Scaling: YingLong-Delayed Chain of Thought in a Large Pretrained Time Series Forecasting Model},
  author = {Xue Wang and Tian Zhou and Jinyang Gao and Bolin Ding and Jingren Zhou},
  journal= {arXiv preprint arXiv:2506.11029},
  year   = {2025}
}