时序基础模型的生成式与潜在自监督学习:衡量预训练贡献
机器学习
2026-05-20 v1 人工智能
摘要
自监督学习(SSL)在视觉和 NLP 领域的成功,推动了其在时序数据的快速采纳。然而,研究主要聚焦于生成式范式和预测任务,未对所学表征的更广泛实用性进行量化。我们建立一个受控框架来评估“预训练贡献”:SSL 在多样化时序任务中所带来的价值增量。我们系统比较生成式范式与潜在对齐架构,引入了针对时序数据的 LeJEPA 和 DINO 适应版本。这些适配版本利用离散小波变换(DWT)数据增强来实现对局部波动的不变性。我们的分析揭示,预训练贡献高度不对称:SSL 对异常检测和分类可实现最高 375% 的提升,但对预测收益有限。我们演示表征实用性并非普适的,受精度-不变性权衡主导,特定信号分辨率必须与任务目标相吻合。最后,我们表明表征质量与数据来源关系不大,且在适中架构深度后即饱和,这为通过大规模合成生成实现规模化提供了路径。我们的代码已公开:https://github.com/noammajor/Models
引用
@article{arxiv.2605.19462,
title = {Quantifying the Pre-training Dividend: Generative versus Latent Self-Supervised Learning for Time Series Foundation Models},
author = {Noam Major and Kathy Razmadze and Yoli Shavit},
journal= {arXiv preprint arXiv:2605.19462},
year = {2026}
}