合成时间序列数据真的不如真实数据好吗?
机器学习
2024-02-02 v1 人工智能
摘要
时间序列数据存在源于数据质量问题、偏差和漏洞以及泛化问题的局限性。整合通用数据合成方法有望改善泛化能力。然而,当前方法无法保证生成器的输出覆盖所有未见过的真实数据。在本文中,我们介绍了 InfoBoost——一个具有时间序列表示学习能力的多功能跨域数据合成框架。我们开发了一种基于合成数据的方法,使得模型训练无需真实数据,且性能超越了使用真实数据训练的模型。此外,我们基于合成数据训练了一个通用的特征提取器,适用于所有时间序列数据。我们的方法克服了多源节律信号干扰、噪声干扰以及超出采样窗口能力的长周期特征的干扰。实验表明,我们的非深度学习合成数据使模型无需真实数据即可实现卓越的重建性能和通用显式表示提取。
引用
@article{arxiv.2402.00607,
title = {Are Synthetic Time-series Data Really not as Good as Real Data?},
author = {Fanzhe Fu and Junru Chen and Jing Zhang and Carl Yang and Lvbin Ma and Yang Yang},
journal= {arXiv preprint arXiv:2402.00607},
year = {2024}
}