中文

STEP:通过跨域蒸馏的科学时间序列编码器预训练

机器学习 2026-03-20 v1 计算与语言

摘要

科学时间序列是科学 AI 的核心,但通常稀疏、高度异构且规模受限,使得统一的表示学习尤为具有挑战性。与此同时,针对相关时间序列领域(如音频、通用时间序列和脑信号)预训练的基础模型包含丰富知识,但其对科学信号的适用性仍未得到充分探索。本文研究了来自相关时间序列领域的基础模型的可迁移性和互补性,以及如何有效地利用它们来构建科学时间序列的统一编码器。我们首先系统评估了相关基础模型,表明知识转移到科学任务上的有效性以及它们的互补优势。基于此观察,我们提出了 STEP(Scientific Time Series Encoder Pretraining),即通过跨域蒸馏的科学时间序列编码器预训练框架。STEP 引入自适应分块以处理极端长度序列,提出统计补偿方案以适应多样化的数值尺度。它进一步利用跨域蒸馏将来自多个基础模型的知识整合到统一的编码器中。通过结合不同领域的互补表示,STEP 学习了为科学信号量身定制的通用且可迁移的特征。在七个科学时间序列任务上的实验表明,STEP 不仅提供了有效的结构,更提供了有效的预训练范式,为科学时间序列表示学习迈出了 STEP 的一步。

关键词

引用

@article{arxiv.2603.18688,
  title  = {STEP: Scientific Time-Series Encoder Pretraining via Cross-Domain Distillation},
  author = {Chen Zhang and Liwei Liu and Jun Tao and Xiaoyu Yang and Xuenan Xu and Kai Chen and Bowen Zhou and Wen Wu and Chao Zhang},
  journal= {arXiv preprint arXiv:2603.18688},
  year   = {2026}
}