机器学习算法的可解释性方法及其在乳腺癌诊断中的应用
机器学习
2022-02-07 v1 人工智能
医学物理
摘要
乳腺癌的早期检测是减轻其社会经济负担的有力手段。尽管人工智能(AI)方法已在此目标上展现出卓越成果,其“黑箱”特性阻碍了在临床实践中的广泛采用。为满足 AI 辅助乳腺癌诊断的需求,可利用可解释性方法。本研究中,我们使用 AI 方法,即随机森林(RF)、神经网络(NN)与神经网络集成(ENN)来实现该目标,并通过全局代理(GS)方法、个体条件期望(ICE)图与夏普利值(SV)等可解释性技术解释并优化其性能。采用开放 UCI 仓库的威斯康星诊断乳腺癌(WDBC)数据集训练和评估 AI 算法。所提 ENN 取得了乳腺癌诊断的最佳性能(准确率 96.6%,ROC 曲线下面积 0.96),其预测由 ICE 图解释,证明决策符合当前医学知识,并可进一步用于获得乳腺癌病理生理机制的新见解。基于 GS 模型特征重要性的特征选择提升了 RF 性能(准确率由 96.49% 升至 97.18%,ROC 曲线下面积由 0.96 升至 0.97),基于 SV 特征重要性的特征选择提升了 NN 性能(准确率由 94.6% 升至 95.53%,ROC 曲线下面积由 0.94 升至 0.95)。相较于同一数据集上的其他方法,我们提出的模型在保持可解释性的同时展现了 SOTA 性能。
引用
@article{arxiv.2202.02131,
title = {Interpretability methods of machine learning algorithms with applications in breast cancer diagnosis},
author = {Panagiota Karatza and Kalliopi V. Dalakleidi and Maria Athanasiou and Konstantina S. Nikita},
journal= {arXiv preprint arXiv:2202.02131},
year = {2022}
}
备注
2021 43rd Annual International Conference of the IEEE Engineering in Medicine & Biology Society (EMBC)