中文

面向海量医疗数据记录插补的多级随机优化

机器学习 2024-04-04 v3 机器学习 应用统计

摘要

长期以来,许多数据集含有显著水平的数值缺失数据是一个公认的问题。将机器学习方法应用于数据集的一个潜在关键前提涉及解决此问题。然而,这是一项具有挑战性的任务。在本文中,我们将最近发展的多级随机优化方法应用于海量医疗记录中的插补问题。该方法基于计算应用数学技术,且具有高精度。特别地,对于最佳线性无偏预测器(BLUP),该多级公式是精确的,并且显著更快且数值更稳定。这使得Kriging方法能够实际应用于海量数据集的数据插补问题。我们在来自全国住院样本(NIS)数据记录、医疗成本与利用项目(HCUP)、医疗研究与质量局的测试了该方方法。数值结果表明,多级方法显著优于当前方法且数值鲁棒。其精度优于HCUP近期报告中推荐的方法。基准测试显示误差降低高达75%。此外,结果也优于近期SOTA方法如判别深度学习。

关键词

引用

@article{arxiv.2110.09680,
  title  = {Multilevel Stochastic Optimization for Imputation in Massive Medical Data Records},
  author = {Wenrui Li and Xiaoyu Wang and Yuetian Sun and Snezana Milanovic and Mark Kon and Julio Enrique Castrillon-Candas},
  journal= {arXiv preprint arXiv:2110.09680},
  year   = {2024}
}

备注

11 pages, 4 figures