中文

基于UCI数据集的心脏病分类集中式与联邦学习模型及其Shapley值可解释性分析

机器学习 2024-08-19 v2

摘要

心血管疾病是全球主要的死亡原因之一,凸显了对准确诊断方法的需求。本研究对使用UCI数据集的心脏病分类集中式与联邦机器学习算法进行了基准测试,该数据集包含来自美国、匈牙利和瑞士四家医院的920条患者记录。我们的基准测试辅以Shapley值可解释性分析,以量化特征对分类的重要性。在集中式设置中,在汇总数据上训练了多种二分类算法,支持向量机(SVM)取得了83.3%的最高测试准确率,超越了逻辑回归78.7%的既定基准。此外,探索了具有四个客户端(医院)的联邦学习算法,利用数据集的自然划分来增强隐私而不牺牲准确率。联邦SVM——文献中较少采用的方法——取得了73.8%的顶级测试准确率。我们的可解释性分析与现有心脏病指标的医学知识一致。总体而言,本研究为高效且可解释的心脏病筛查工具建立了基准,同时保持了患者的隐私。该工作可在 https://github.com/padillma1/Heart-Disease-Classification-on-UCI-dataset-and-Shapley-Interpretability-Analysis 获取。

关键词

引用

@article{arxiv.2408.06183,
  title  = {Centralized and Federated Heart Disease Classification Models Using UCI Dataset and their Shapley-value Based Interpretability},
  author = {Mario Padilla Rodriguez and Mohamed Nafea},
  journal= {arXiv preprint arXiv:2408.06183},
  year   = {2024}
}