中文

全面数据预处理对 COVID-19 死亡率预测建模的影响

机器学习 2026-02-27 v1

摘要

准确的预测模型对于分析 COVID-19 死亡趋势至关重要。本研究评估了自定义数据预处理流水线对十种机器学习模型预测 COVID-19 死亡率的影响,数据来源于 Our World in Data (OWID)。我们的流水线通过四个关键步骤与标准预处理流水线有所不同。首先,它将每周报告的总数转换为每日更新,纠正报告偏差并提供更准确的估计。其次,它使用局部异常检测与处理来保留数据方差并提高准确性。第三,它利用列之间的计算依赖关系来确保数据一致性。最后,它纳入迭代特征选择过程以优化特征集并提升模型性能。结果表明,自定义流水线带来了显著改善:MLP 回归器实现了测试 RMSE 为 66.556 和测试 R-squared 为 0.991,超越了标准流水线中的 DecisionTree 回归器,后者测试 RMSE 为 222.858、测试 R-squared 为 0.817。这些发现强调了定制化预处理技术在提升 COVID-19 死亡率预测建模准确性方面的重要性。尽管仅适用于本研究,但这些方法论为多样化的数据集和领域提供了有价值的见解,从而改善了各种情境下的预测性能。

关键词

引用

@article{arxiv.2408.08142,
  title  = {Impact of Comprehensive Data Preprocessing on Predictive Modelling of COVID-19 Mortality},
  author = {Sangita Das and Subhrajyoti Maji},
  journal= {arXiv preprint arXiv:2408.08142},
  year   = {2026}
}

备注

8 pages, 5 figures, 2 tables