合则预训练,分则失败!基于同时预训练75个数据集的时间序列表示学习
机器学习
2024-02-26 v1
摘要
在自然语言处理和视觉领域,预训练被用于学习有效的表示。不幸的是,由于源域和目标域之间可能存在不匹配,预训练的成功不易推广到时间序列。实际上,普遍认为多数据集预训练对时间序列不起作用!恰恰相反,我们引入了一种新的自监督对比预训练方法,从许多无标签且多样化的时间序列数据集中学习一个编码,这样学习到的单一表示就可以重复用于多个目标域,例如用于分类。具体来说,我们提出了XD-MixUp插值方法和软插值上下文对比(SICC)损失。实验表明,在低数据量情况下进行微调时,该方法优于监督训练和其他自监督预训练方法。这反驳了普遍看法:我们实际上可以从多个时间序列数据集中学习,甚至同时从75个数据集中学习。
引用
@article{arxiv.2402.15404,
title = {United We Pretrain, Divided We Fail! Representation Learning for Time Series by Pretraining on 75 Datasets at Once},
author = {Maurice Kraus and Felix Divo and David Steinmann and Devendra Singh Dhami and Kristian Kersting},
journal= {arXiv preprint arXiv:2402.15404},
year = {2024}
}