中文

孟加拉国患者背景下的乳腺癌分类预测建模:一种基于可解释 AI 的监督机器学习方法

机器学习 2024-04-09 v1 人工智能 计算机视觉与模式识别

摘要

近年来乳腺癌发病率迅速上升,使其成为全球主要死亡原因之一。在所有癌症中,乳腺癌是迄今为止最常见的一种。人工诊断这种疾病需要大量时间和专业知识。由于检测乳腺癌是一个耗时的过程,创建基于机器的预测有助于防止其进一步扩散。机器学习和可解释 AI 在分类中至关重要,因为它们不仅提供准确的预测,还提供了对模型如何做出决策的洞察,有助于理解分类结果并增强其可信度。在本研究中,我们使用一个主要数据集(来自达卡医学院医院的 500 名患者)评估并比较了五种不同机器学习方法的分类准确率、精确率、召回率和 F-1 分数。我们使用了五种不同的监督机器学习技术,包括决策树、随机森林、逻辑回归、朴素贝叶斯和 XGBoost,以在我们的数据集上获得最优结果。此外,本研究对 XGBoost 模型应用了 SHAP 分析,以解释模型的预测并理解每个特征对模型输出的影响。我们比较了几种算法对数据进行分类的准确性,并与该领域的其他文献进行了对比。经过最终评估,本研究发现 XGBoost 取得了最佳的模型准确率,达到 97%。

关键词

引用

@article{arxiv.2404.04686,
  title  = {Predictive Modeling for Breast Cancer Classification in the Context of Bangladeshi Patients: A Supervised Machine Learning Approach with Explainable AI},
  author = {Taminul Islam and Md. Alif Sheakh and Mst. Sazia Tahosin and Most. Hasna Hena and Shopnil Akash and Yousef A. Bin Jardan and Gezahign Fentahun Wondmie and Hiba-Allah Nafidi and Mohammed Bourhia},
  journal= {arXiv preprint arXiv:2404.04686},
  year   = {2024}
}

备注

Accepted for the Scientific Reports (Nature) journal. 32 pages, 12 figures