中文

CauKer:分类时间序列基础模型可基于合成数据进行预训练

机器学习 2026-03-10 v3 人工智能

摘要

时间序列基础模型 (TSFMs) 因其强大的零样本能力与广泛的现实世界应用而近期受到广泛关注。此类模型通常需要在大规模、精心筛选的真实世界序列集合上进行计算成本高昂的预训练。为实现 TSFMs 的样本高效预训练,我们提出 \textsc{CauKer},这是一种旨在生成具有真实趋势、季节性与非线性交互的多样化、因果连贯合成时间序列的新颖算法。\textsc{CauKer} 将高斯过程 (GP) 核函数组合与结构因果模型 (SCM) 相结合,为具有不同架构并遵循不同预训练方法的最先进分类 TSFMs 生成数据,以实现样本高效的预训练。此外,我们的实验表明,\textsc{CauKer} 生成的数据集在数据集规模(1 万至 1000 万样本)与模型容量(100 万至 7.83 亿参数)上均表现出清晰的缩放规律,而真实世界数据集则呈现不规则的缩放行为。源代码公开于 https://github.com/ShifengXIE/CauKer。

关键词

引用

@article{arxiv.2508.02879,
  title  = {CauKer: Classification Time Series Foundation Models Can Be Pretrained on Synthetic Data},
  author = {Shifeng Xie and Vasilii Feofanov and Ambroise Odonnat and Lei Zan and Marius Alonso and Jianfeng Zhang and Themis Palpanas and Lujia Pan and Keli Zhang and Ievgen Redko},
  journal= {arXiv preprint arXiv:2508.02879},
  year   = {2026}
}

备注

This manuscript combines material from the ICML 2025 TSFM Workshop paper and the ICLR 2026 Main Track paper