关于医疗数据集缺失值插补技术的性能研究
机器学习
2024-03-25 v1 人工智能
摘要
缺失值或缺失数据是现实世界数据集,尤其是医疗数据的一个普遍特征。当在这类数据集上使用机器学习算法时,这可能会令人沮丧,因为大多数机器学习模型在存在缺失值时表现不佳。本研究的目的是比较七种插补技术的性能,即均值插补、中位数插补、末次观测值结转(LOCF)插补、K近邻(KNN)插补、插值插补、Missforest插补和链式方程多重插补(MICE),应用于三个医疗数据集。数据集中被引入了一定比例的缺失值——10%、15%、20%和25%,并采用这些插补技术来插补这些缺失值。它们的性能比较通过均方根误差(RMSE)和平均绝对误差(MAE)进行评估。结果表明,Missforest插补表现最好,其次是MICE插补。此外,我们试图通过使用召回率、精确率、F1分数和准确率这些指标,来确定是在插补前进行特征选择更好,还是反之。由于关于此方面的文献较少且研究人员之间存在一些争议,我们希望本实验的结果能鼓励数据科学家和研究人员在处理包含缺失值的数据时,先进行插补再进行特征选择。
引用
@article{arxiv.2403.14687,
title = {On the Performance of Imputation Techniques for Missing Values on Healthcare Datasets},
author = {Luke Oluwaseye Joel and Wesley Doorsamy and Babu Sena Paul},
journal= {arXiv preprint arXiv:2403.14687},
year = {2024}
}