通过双域匹配进行时序分类的数据集凝练
机器学习
2024-06-11 v3
摘要
时序数据已被证明在各种研究领域至关重要。管理大量时序数据给深度学习任务带来了挑战,特别是在训练深度神经网络时。最近,一种名为数据集凝练 (Dataset Condensation) 的技术作为解决这一问题的方案应运而生。该技术生成一个较小的合成数据集,其在分类等下游任务中的性能可与完整真实数据集相媲美。然而,以往的方法主要针对图像和图数据集设计,直接将其适配到时序数据集会导致性能欠佳,因为它们无法有效利用时序数据中固有的丰富信息,特别是在频域中。在本文中,我们提出了一种名为通过双域匹配进行时序分类数据集凝练 (CondTSC) 的新框架,专注于时序分类数据集凝练任务。与以往方法不同,我们提出的框架旨在生成一个在时域和频域中都能匹配代理目标的凝练数据集。具体而言,CondTSC 结合了多视图数据增强、双域训练和双代理目标,以增强时域和频域中的数据集凝练过程。通过大量实验,我们证明了所提框架的有效性,其优于其他基线方法,并学习到一个符合原始数据分布等理想特征的凝练合成数据集。
引用
@article{arxiv.2403.07245,
title = {Dataset Condensation for Time Series Classification via Dual Domain Matching},
author = {Zhanyu Liu and Ke Hao and Guanjie Zheng and Yanwei Yu},
journal= {arXiv preprint arXiv:2403.07245},
year = {2024}
}
备注
Accepted by KDD 2024 research track