中文

用于分类的时间序列表示隐藏于预训练视觉Transformer之中

机器学习 2025-07-03 v2 人工智能 计算机视觉与模式识别

摘要

时间序列分类是医疗和工业领域的基础任务,但时间序列基础模型(TSFMs)的发展受限于公开可用时间序列数据集的匮乏。在本工作中,我们提出了Time Vision Transformer(TiViT)框架,将时间序列转换为图像,以利用在大规模图像数据集上预训练的冻结视觉Transformer(ViT)的表示能力。首先,我们通过分析ViT对时间序列的二维分块,从理论上论证了该方法可以增加与标签相关的token数量并降低样本复杂度。其次,我们通过实证证明TiViT利用大型OpenCLIP模型的隐藏表示,在标准时间序列分类基准上达到了最先进的性能。我们探索了TiViT表示的结构,发现具有高内蕴维度的中间层对时间序列分类最为有效。最后,我们评估了TiViT与TSFM表示空间之间的对齐关系,发现了强烈的互补性,通过组合两者特征可进一步提升性能。我们的发现揭示了将视觉表示重用于非视觉领域的新方向。代码可在 https://github.com/ExplainableML/TiViT 获取。

关键词

引用

@article{arxiv.2506.08641,
  title  = {Time Series Representations for Classification Lie Hidden in Pretrained Vision Transformers},
  author = {Simon Roschmann and Quentin Bouniot and Vasilii Feofanov and Ievgen Redko and Zeynep Akata},
  journal= {arXiv preprint arXiv:2506.08641},
  year   = {2025}
}

备注

Preprint