用于解释黑盒模型的多数据集早期阿尔茨海默病分类机器学习工作流
机器学习
2022-11-08 v2 人工智能
摘要
目的:难以解释的黑盒机器学习(ML)常用于早期阿尔茨海默病(AD)检测。方法:为解释极端梯度提升(XGBoost)、随机森林(RF)和支持向量机(SVM)黑盒模型,开发了一个基于Shapley值的工作流。所有模型在阿尔茨海默病神经影像计划(ADNI)数据集上训练,并在独立的ADNI测试集以及外部的澳大利亚影像、生物标志物和生活方式衰老旗舰研究(AIBL)和开放获取影像研究系列(OASIS)数据集上评估。将Shapley值与直观可解释的决策树(DT)、逻辑回归(LR)以及自然和置换特征重要性进行比较。为避免相关特征导致解释有效性降低,实施了前向选择和方面合并。结果:部分黑盒模型优于DT和LR。前向选择的特征对应于先前认为与AD相关的脑区。Shapley值识别出生物学上合理的关联,与特征重要性呈中度至强相关。预测AD转化的RF最重要特征是杏仁体体积和一项认知测试分数。良好的认知测试表现和较大的脑体积降低了AD风险。使用认知测试分数训练的模型显著优于脑体积模型()。认知正常(CN)与AD的模型成功迁移到外部数据集。结论:与以往工作相比,利用脑体积进行CN与轻度认知障碍(MCI)分类在ADNI和AIBL上取得了更好的性能。Shapley值与特征重要性呈中度至强相关。
引用
@article{arxiv.2205.05907,
title = {Machine Learning Workflow to Explain Black-box Models for Early Alzheimer's Disease Classification Evaluated for Multiple Datasets},
author = {Louise Bloch and Christoph M. Friedrich},
journal= {arXiv preprint arXiv:2205.05907},
year = {2022}
}