中文

基于梯度提升算法的乳腺癌分类:减少假阴性结果及 SHAP 可解释性

软件工程 2024-03-15 v1 机器学习

摘要

癌症是全球致死女性最多的疾病之一,乳腺癌造成的癌症病例和死亡人数居首位。然而,通过早期检测和随后的早期治疗可以予以预防。这一研究旨在使用梯度提升算法预测乳腺癌,关注降低假阴性结果,并利用 SHAP 方法提高可解释性。本研究使用 UCI 存储库的数据集训练和测试模型分类器。研究的主要目标是使用 AdaBoost、XGBoost、CatBoost 和 LightGBM 等最新提升算法预测和诊断乳腺癌,并找到最有效的召回率、ROC-AUC 和混淆矩阵指标。我们是首次将这四种提升算法与 Optuna(用于超参数优化的库)结合使用,并利用 SHAP 方法提高模型可解释性,以支持乳腺癌的识别和预测。我们能够提高所有模型的 AUC 或召回率,并在 AdaBoost 和 LightGBM 中显著降低假阴性结果,最终所有模型的 AUC 超过 99.41%。

关键词

引用

@article{arxiv.2403.09547,
  title  = {How do Machine Learning Projects use Continuous Integration Practices? An Empirical Study on GitHub Actions},
  author = {João Helis Bernardo and Daniel Alencar da Costa and Sérgio Queiroz de Medeiros and Uirá Kulesza},
  journal= {arXiv preprint arXiv:2403.09547},
  year   = {2024}
}

备注

10 pages, Mining Software Repositories, MSR 2024