缓解时间序列分析中的数据稀缺性:基于序列-符号数据生成的基础模型
机器学习
2025-02-24 v1 人工智能
摘要
时间序列分析的基础模型引起了广泛关注。然而,数据稀缺和数据不平衡等挑战仍阻碍了其发展。为此,我们考虑通过表示时间序列的符号表达式作为其语义描述符来建模复杂系统。基于这一概念,我们引入一种序列-符号 (S2) 双模态数据生成机制,实现高质量时间序列数据及其相应符号表示的无限制创建。利用 S2 数据集,我们开发了面向时间序列分析的 SymTime 预训练基础模型。当在下游任务上微调时,SymTime 在五大主要时间序列分析任务上表现出竞争力,与预训练于真实世界数据集的基础模型不相上下。这一方法凸显了双模态数据生成和预训练机制在克服数据稀缺性和提升任务性能方面的潜力。
引用
@article{arxiv.2502.15466,
title = {Mitigating Data Scarcity in Time Series Analysis: A Foundation Model with Series-Symbol Data Generation},
author = {Wenxuan Wang and Kai Wu and Yujian Betterest Li and Dan Wang and Xiaoyu Zhang and Jing Liu},
journal= {arXiv preprint arXiv:2502.15466},
year = {2025}
}