时间序列分类的数据增强:一项广泛的实证研究及全面综述
机器学习
2025-07-01 v7
摘要
数据增强(DA)已成为时间序列分类(TSC)中的关键方法,主要因其能够扩充训练数据集、增强模型鲁棒性、引入多样性并减少过拟合。然而,当前 TSC 领域的 DA 研究存在文献综述碎片化、方法学分类模糊、评估手段不足以及缺乏面向用户且易用的工具等问题。本研究通过对 TSC 领域内 DA 方法的全面考察来应对这些挑战。我们的研究始于跨越十年的广泛文献综述,揭示了现有综述中的显著空白,并对超过 100 篇学术文章进行细致分析以识别出 60 多种不同的 DA 技术。这一严谨的综述促成了一种专为 TSC 中 DA 特定需求而设计的新分类法,将技术分为五大类:基于变换的、基于模式的、生成式的、基于分解的以及自动化数据增强。该分类法旨在以更清晰的方式指导研究者选择合适的方法。针对基础 DA 技术缺乏全面评估的问题,我们开展了一项透彻的实证研究,在代表 UCR 时间序列库中全部类型的 15 个多样化数据集上测试了近 20 种 DA 策略。使用 ResNet 和 LSTM 架构,我们采用了多维度评估方法,包括准确率、方法排序和残差分析等指标,在 ResNet 上取得了 84.98 ± 16.41% 的基准准确率,在 LSTM 上取得了 82.41 ± 18.71% 的基准准确率。我们的研究强调了 DA 技术效果的不一致性,例如,RGWs 和随机置换等方法显著提升了模型性能,而诸如 EMD 等其他方法效果较差。
引用
@article{arxiv.2310.10060,
title = {Data Augmentation for Time-Series Classification: An Extensive Empirical Study and Comprehensive Survey},
author = {Zijun Gao and Haibao Liu and Lingbo Li},
journal= {arXiv preprint arXiv:2310.10060},
year = {2025}
}