初期慢性肾病(CKD)检测:一种面向不同 ML 技术的混合特征选择新方法与鲁棒数据准备流程
机器学习
2022-03-04 v1 人工智能
摘要
慢性肾病(CKD)已感染全球近 8 亿人。每年约 170 万人死于该病。在初期检测 CKD 对挽救数百万生命至关重要。许多研究者已应用不同的机器学习(ML)方法早期检测 CKD,但详尽研究仍然缺失。我们提出了一种结构化且详尽的方法,以最优性能处理医疗数据的复杂性。此外,本研究将协助研究者清晰理解医疗数据准备流程。本文中,我们应用 KNN 插补处理缺失值、局部离群因子去除离群点、SMOTE 处理数据不平衡、K-分层 K 折交叉验证验证 ML 模型,以及一种去除冗余特征的混合特征选择新方法。本研究所用算法包括支持向量机、高斯朴素贝叶斯、决策树、随机森林、逻辑回归、K-近邻、梯度提升、自适应提升与极端梯度提升。最终,随机森林可在无任何数据泄漏的情况下以 100% 准确率检测 CKD。
引用
@article{arxiv.2203.01394,
title = {Detecting Chronic Kidney Disease(CKD) at the Initial Stage: A Novel Hybrid Feature-selection Method and Robust Data Preparation Pipeline for Different ML Techniques},
author = {Md. Taufiqul Haque Khan Tusar and Md. Touhidul Islam and Foyjul Islam Raju},
journal= {arXiv preprint arXiv:2203.01394},
year = {2022}
}
备注
8 pages, 4 figures, Accepted in the Proceeding of the International Conference on Computing and Informatics (ICCI), 09-10 March 2022