中文

多数据驱动的缺失插值

统计方法学 2025-07-08 v1 机器学习 机器学习

摘要

本文介绍了 KZImputer,这是一种用于单变量时间序列的新型自适应插值方法,旨在处理规模为 1-5 个缺失点(间隔)及更大范围的短至中等规模缺失数据。KZImputer 采用混合策略来处理各种缺失数据情形。其核心机制区分序列开头、中间或结尾处的间隔,针对每个位置应用量身定制的技术,以优化插值准确性。该方法利用线性插值和局部统计量,根据周围数据特征和间隔大小进行自适应。KZImputer 的性能已系统评估,对比已建立的插值技术,显示其有潜力提高后续时间序列分析的数据质量。本文详细描述了 KZImputer 的方法论,并讨论了其在提高时间序列数据完整性方面的有效性。经验分析表明,KZImputer 在缺失率约 50% 或更高的数据集上实现了尤为出色的性能,在统计和信号重构指标上保持稳定且具有竞争力的结果。该方法在高稀疏 regime 中尤为有效,而传统方法通常会出现准确度下降。

关键词

引用

@article{arxiv.2507.03061,
  title  = {Multiple data-driven missing imputation},
  author = {Sergii Kavun},
  journal= {arXiv preprint arXiv:2507.03061},
  year   = {2025}
}

备注

https://github.com/s-kav/kz_data_imputation