中文

DDTime:基于谱对齐和信息瓶颈的时间序列数据集蒸馏

机器学习 2025-11-24 v1 人工智能

摘要

时间序列预测是诸多领域的基础任务,但准确建模往往需要大规模数据集和大量计算资源。数据集蒸馏通过合成紧凑数据集来保留完整数据学习行为,提供了可行的替代方案。然而,将数据集蒸馏扩展至时间序列预测面临两个根本性挑战:1. 由于强自相关性导致的时序偏差,使教师模型与学生模型之间的值项对齐失真;2. 合成样本的多样性不足,因缺乏显式类别性先验来正则化轨迹多样性。在本文中,我们提出了 DDTime 框架,基于一阶凝结分解构建,具有轻量级和即插即用的特性。为解决挑战 1,框架通过时序统计重新审视值项对齐,引入频域对齐机制以缓解自相关引发的偏差,确保谱系一致性和时序保真性。为解决挑战 2,我们进一步设计一种受信息瓶颈原理启发的跨样本正则化,增强样本多样性,最大化合成轨迹间的信息密度。该目标函数与广泛的凝结范式理论兼容,支持稳定的一阶优化。在 20 个基准数据集和多样化预测模型架构上的大量实验表明,DDTime 持续优于现有蒸馏方法,实现约 30% 的相对精度提升,同时仅引入约 2.49% 的计算开销。所有代码和蒸馏后数据集将公开发布。

关键词

引用

@article{arxiv.2511.16715,
  title  = {DDTime: Dataset Distillation with Spectral Alignment and Information Bottleneck for Time-Series Forecasting},
  author = {Yuqi Li and Kuiye Ding and Chuanguang Yang and Hao Wang and Haoxuan Wang and Huiran Duan and Junming Liu and Yingli Tian},
  journal= {arXiv preprint arXiv:2511.16715},
  year   = {2025}
}

备注

36 pages