中文

TOTEM:用于通用时间序列分析的令牌化时间序列嵌入

机器学习 2025-01-03 v2

摘要

这项工作研究了使用通用(或基础)模型进行时间序列分析的问题,这些模型是在许多数据域上训练的。受大型语言模型广泛成功的启发,我们考虑了一种简单的策略,即通过自监督对来自众多数据集的时间序列数据进行离散令牌化,然后使用固定的令牌化来解决许多数据域中的各种任务。传统上,时间序列模型要么在单个数据集上训练,要么以特定于任务的方式构建(例如,仅用于预测的模型),其中许多模型使用时间片段作为输入。因此,在许多任务中探索的高性能通用离散表示时间序列模型具有价值。我们的方法 TOTEM(TOkenized Time Series EMbeddings)生成了此类通用时间序列模型,只需极少或无需微调,同时表现出强大的零样本性能。我们在三个常用时间序列任务上使用真实世界数据对 TOTEM 进行了广泛评估,进行了近 500 次实验:插补(17 个基线,12 个数据集)、异常检测(19 个基线,25 个数据集)和预测(14 个基线,12 个数据集)。我们得出结论,TOTEM 在规范的专家设置(即在一个域上训练一个模型)和通用设置(即在许多域上训练一个模型)中均匹配或优于现有的最先进模型,这证明了令牌化对于通用时间序列分析的有效性。开源实现可在此处获取:https://github.com/SaberaTalukder/TOTEM;视频摘要可在此处获取:https://www.youtube.com/watch?v=OqrCpdb6MJk。

关键词

引用

@article{arxiv.2402.16412,
  title  = {TOTEM: TOkenized Time Series EMbeddings for General Time Series Analysis},
  author = {Sabera Talukder and Yisong Yue and Georgia Gkioxari},
  journal= {arXiv preprint arXiv:2402.16412},
  year   = {2025}
}

备注

Accepted to TMLR (12/24), 33 pages. TMLR link: https://openreview.net/pdf?id=QlTLkH6xRC