乳腺癌治疗与生育数据缺失值的插补技术
机器学习
2020-11-20 v1 统计方法学
摘要
近年来,使用数据挖掘技术的临床决策支持提供了更智能的方式来减少决策错误。然而,临床数据集常存在高缺失率,若处理不当会对建模质量产生不利影响。插补缺失值为解决该问题提供了途径。常规插补方法采用简单的统计分析,如均值插补或丢弃缺失样本,具有诸多局限并因此降低学习性能。本研究考察了一系列基于机器学习的插补方法,并提出了一种高效方法以准备高质量的乳腺癌(BC)数据集,以探寻 BC 治疗与化疗相关闭经之间的关系,其性能通过预测准确率进行评估。
引用
@article{arxiv.2011.09912,
title = {Imputation techniques on missing values in breast cancer treatment and fertility data},
author = {Xuetong Wu and Hadi Akbarzadeh Khorshidi and Uwe Aickelin and Zobaida Edib and Michelle Peate},
journal= {arXiv preprint arXiv:2011.09912},
year = {2020}
}
备注
Health Information Science and Systems, Volume 7, Issue 1