面向数据集中缺失问题的处理方法论及其在人口健康数据集上的应用
机器学习
2022-11-08 v1 人工智能
摘要
缺失数据是健康数据集中常见的关切,其对良好决策过程的影响已有充分记载。本研究的贡献是一种利用合成数据集生成、缺失数据插补与深度学习方法相结合来解决缺失数据挑战的方法论。具体而言,我们开展了一系列实验以实现以下目标: 生成逼真的合成数据集, 模拟数据缺失, 恢复缺失数据,以及 分析插补性能。我们的方法论使用高斯混合模型,其参数从真实人口与健康数据集的清洗子集中学习以生成合成数据。我们在完全随机缺失机制 MCAR 下模拟了从 、、 到 的不同缺失程度。我们采用了涉及聚类、分类与直接插补分析的集成性能分析框架。结果显示,在合成与插补数据集上训练的模型能够分别对 未见过真实数据集与 未见过保留合成测试数据集以 与 准确率进行预测。此外,采用 DAE 方法进行插补的模型给出了最低对数损失,表明性能良好,尽管准确率指标略低。总之,我们的工作表明使用该方法论可逆向工程出一种方案,以解决未见含缺失数据集上的缺失问题。而且,尽管我们使用了健康数据集,该方法论亦可应用于其他情境。
引用
@article{arxiv.2211.02856,
title = {Towards a methodology for addressing missingness in datasets, with an application to demographic health datasets},
author = {Gift Khangamwa and Terence L. van Zyl and Clint J. van Alten},
journal= {arXiv preprint arXiv:2211.02856},
year = {2022}
}
备注
16 pages and references, 5 figures and four tables, Paper accepted for presentation at SACAIR 2022 in Stellenbosch, Westen Cape, South Africa