中文

LiPCoT:基于线性预测编码的用于语言模型时间序列自监督学习的分词器

机器学习 2024-08-15 v1 人工智能 信号处理

摘要

语言模型已在各种自然语言处理任务中取得了显著成功。然而,它们在时间序列数据(许多领域的关键组成部分)上的应用仍然有限。本文提出了 LiPCoT(基于线性预测编码的时间序列分词器),这是一种新颖的分词器,将时间序列数据编码为标记序列,使使用现有语言模型架构(如 BERT)进行时间序列自监督学习成为可能。与依赖 CNN 编码器进行时间序列特征生成的传统时间序列分词器不同,LiPCoT 通过线性预测编码采用随机建模,为时间序列创建一个潜在空间,提供对数据固有随机性质的紧凑而丰富的表示。此外,LiPCoT 计算效率高,可以有效处理具有不同采样率和长度的时间序列数据,克服了现有时间序列分词器的常见局限性。在这项概念验证工作中,我们展示了 LiPCoT 在利用来自 46 名参与者的 EEG 数据集对帕金森病(PD)进行分类方面的有效性。具体而言,我们利用 LiPCoT 将 EEG 数据编码为小词汇量的标记,然后使用 BERT 进行自监督学习和 PD 分类的下游任务。我们将我们的方法与几种最先进的基于 CNN 的深度学习架构进行了 PD 检测的基准比较。我们的结果表明,利用自监督学习的 BERT 模型在精确度上优于表现最好的现有方法 7.1%,在召回率上优于 2.3%,在准确率上优于 5.5%,在 AUC 上优于 4%,在 F1 分数上优于 5%,凸显了即使在小数据集上自监督学习的潜力。我们的工作将为未来的时间序列基础模型提供参考,特别是针对自监督学习。

关键词

引用

@article{arxiv.2408.07292,
  title  = {LiPCoT: Linear Predictive Coding based Tokenizer for Self-supervised Learning of Time Series Data via Language Models},
  author = {Md Fahim Anjum},
  journal= {arXiv preprint arXiv:2408.07292},
  year   = {2024}
}

备注

17 pages, 5 figures