使用梯度提升算法进行乳腺癌分类:聚焦于降低假阴性率与 SHAP 可解释性
机器学习
2025-09-23 v3 人工智能
计算机与社会
定量方法
摘要
癌症是全球导致女性死亡最多的疾病之一,其中乳腺癌造成的癌症病例数量最多,因此死亡人数也最多。然而,可以通过早期发现进而早期治疗来预防。任何用于检测或预测此类癌症的进展对于更好的健康生活都很重要。许多研究专注于在癌症预测中具有高准确率的模型,但有时仅凭准确率并不总是一个可靠的指标。本研究采用一种调查方法来研究基于提升的不同机器学习算法在预测乳腺癌方面的性能,重点关注召回率指标。提升机器学习算法已被证明是检测医疗疾病的有效工具。利用加州大学欧文分校 (UCI) 仓库的数据集来训练和测试包含其属性的模型分类器。本研究的主要目标是使用最先进的提升算法(如 AdaBoost、XGBoost、CatBoost 和 LightGBM)来预测和诊断乳腺癌,并找出关于召回率、ROC-AUC 和混淆矩阵的最有效指标。此外,我们的研究首次将这四种提升算法与用于超参数优化的库 Optuna 以及 SHAP 方法结合使用,以提高模型的可解释性,这可以用作识别和预测乳腺癌的支持。我们能够提高所有模型的 AUC 或召回率,并降低了 AdaBoost 和 LightGBM 的假阴性率,所有模型的最终 AUC 均超过 99.41%。
引用
@article{arxiv.2403.09548,
title = {Breast Cancer Classification Using Gradient Boosting Algorithms Focusing on Reducing the False Negative and SHAP for Explainability},
author = {João Manoel Herrera Pinheiro and Marcelo Becker},
journal= {arXiv preprint arXiv:2403.09548},
year = {2025}
}
备注
9 pages, 16 figures