中文

面向跨领域时间序列分析任务的大规模预训练时间序列模型

机器学习 2024-12-06 v3

摘要

大规模预训练模型在语言和视觉等领域的近期进展中至关重要,使针对单个下游任务的模型训练更高效并提供更优性能。然而,处理时间序列分析任务通常需要根据任务特定的训练数据和领域专业知识,从头设计并训练一个单独的模型。我们应对从多领域时间序列数据集预训练基础时间序列模型的一个重大挑战:从不同领域的异构时间序列中提取对模型有语义有用的 token 化输入。我们提出大规模预训练时间序列模型(LPTM),其引入一种新颖的自适应分割方法,在预训练期间自动识别最优的 dataset-specific 分割策略。这使得 LPTM 在微调至不同下游时间序列分析任务及零样本设定下,表现与领域特定的 SOTA 模型相似或更好。与 SOTA 基线相比,LPTM 在取得更优预测与时间序列分类结果的同时,所用数据最多减少 40%,训练时间最多减少 50%。代码:www.github.com/AdityaLab/Samay

关键词

引用

@article{arxiv.2311.11413,
  title  = {Large Pre-trained time series models for cross-domain Time series analysis tasks},
  author = {Harshavardhan Kamarthi and B. Aditya Prakash},
  journal= {arXiv preprint arXiv:2311.11413},
  year   = {2024}
}

备注

Accepted at NeurIPS 2024. Code: https://github.com/AdityaLab/Samay