中文

时间序列健康数据缺失值深度插补:综述与基准测试

机器学习 2023-05-17 v2 人工智能

摘要

多变量时间序列(MTS)数据中缺失值的插补对保障数据质量与生成可靠的数据驱动预测模型至关重要。除众多统计方法外,近期少数研究提出最先进的深度学习方法以插补MTS数据中的缺失值。然而,这些深度方法的评估局限于一两个数据集、低缺失率及完全随机缺失类型。本综述通过六项以数据为中心的实验,在五个时间序列健康数据集上基准测试最先进的深度插补方法。我们广泛的分析揭示,没有单一插补方法在所有五个数据集上均优于其他。插补性能取决于数据类型、单变量统计、缺失值率与类型。联合执行横截面(跨变量)与纵向(跨时间)缺失值插补的深度学习方法比传统插补方法在统计上产出更优数据质量。尽管计算昂贵,鉴于当前高性能计算资源的可用性,深度学习方法具实用性,尤其在医疗信息学中数据质量与样本量高度重要时。我们的发现凸显了以数据为中心的插补方法选择对优化数据驱动预测模型的重要性。

关键词

引用

@article{arxiv.2302.10902,
  title  = {Deep Imputation of Missing Values in Time Series Health Data: A Review with Benchmarking},
  author = {Maksims Kazijevs and Manar D. Samad},
  journal= {arXiv preprint arXiv:2302.10902},
  year   = {2023}
}