中文

用于时间序列基础模型的合成序列-符号数据生成

机器学习 2025-10-21 v3 人工智能

摘要

时间序列分析的基础模型(TSA)引起了广泛关注。然而,训练数据的稀缺与不平衡仍然阻碍了其发展。灵感来自复杂动态系统理论,我们设计了序列-符号数据生成机制,实现了高质量时间序列数据与对应符号表达式的无限制生成。为充分利用序列-符号数据对中强相关性,我们开发了SymTime——一个基于符号信息增强时间序列表示的预训练基础模型。当在下游任务上微调时,SymTime在五大主要时间序列分析任务上表现出竞争力,与基于真实数据集预训练的基础模型一较高下。该方法凸显了序列-符号数据生成和预训练机制在克服数据稀缺性及提升任务性能方面的潜力。代码已公开于 https://github.com/wwhenxuan/SymTime。

关键词

引用

@article{arxiv.2510.08445,
  title  = {Synthetic Series-Symbol Data Generation for Time Series Foundation Models},
  author = {Wenxuan Wang and Kai Wu and Yujian Betterest Li and Dan Wang and Xiaoyu Zhang},
  journal= {arXiv preprint arXiv:2510.08445},
  year   = {2025}
}

备注

64 pages, 25 figures, 35 tables, NeurIPS 2025 accepted