中文

合则预训练,分则失败!基于同时预训练75个数据集的时间序列表示学习

机器学习 2024-02-26 v1

摘要

在自然语言处理和视觉领域,预训练被用于学习有效的表示。不幸的是,由于源域和目标域之间可能存在不匹配,预训练的成功不易推广到时间序列。实际上,普遍认为多数据集预训练对时间序列不起作用!恰恰相反,我们引入了一种新的自监督对比预训练方法,从许多无标签且多样化的时间序列数据集中学习一个编码,这样学习到的单一表示就可以重复用于多个目标域,例如用于分类。具体来说,我们提出了XD-MixUp插值方法和软插值上下文对比(SICC)损失。实验表明,在低数据量情况下进行微调时,该方法优于监督训练和其他自监督预训练方法。这反驳了普遍看法:我们实际上可以从多个时间序列数据集中学习,甚至同时从75个数据集中学习。

关键词

引用

@article{arxiv.2402.15404,
  title  = {United We Pretrain, Divided We Fail! Representation Learning for Time Series by Pretraining on 75 Datasets at Once},
  author = {Maurice Kraus and Felix Divo and David Steinmann and Devendra Singh Dhami and Kristian Kersting},
  journal= {arXiv preprint arXiv:2402.15404},
  year   = {2024}
}