中文

TimeDistill:通过跨架构蒸馏实现基于 MLP 的高效长期时间序列预测

机器学习 2026-01-08 v3

摘要

基于 Transformer 和 CNN 的方法在长期时间序列预测中表现出强大性能。然而,它们高昂的计算和存储需求可能阻碍大规模部署。为解决这一局限,我们提出利用知识蒸馏将轻量级 MLP 与先进架构相结合。我们的初步研究揭示,不同模型可以捕捉互补模式,特别是在时域和频域中的多尺度和多周期模式。基于这一观察,我们引入 TimeDistill,一个跨架构知识蒸馏框架,将这些模式从教师模型(如 Transformer、CNN)迁移到 MLP。此外,我们提供了理论分析,证明我们的知识蒸馏方法可被解释为一种特殊形式的 mixup 数据增强。TimeDistill 将 MLP 性能提升高达 18.6%,在八个数据集上超越了教师模型。它还实现了高达 7 倍的推理加速,并减少了 130 倍的参数量。此外,我们进行了广泛评估,以突出 TimeDistill 的通用性和有效性。

关键词

引用

@article{arxiv.2502.15016,
  title  = {TimeDistill: Efficient Long-Term Time Series Forecasting with MLP via Cross-Architecture Distillation},
  author = {Juntong Ni and Zewen Liu and Shiyu Wang and Ming Jin and Wei Jin},
  journal= {arXiv preprint arXiv:2502.15016},
  year   = {2026}
}

备注

Accepted at KDD 2026, we release our code publicly at https://github.com/LingFengGold/TimeDistill