面向 COVID-19 的可解释机器学习:严重程度预测任务的实证研究
机器学习
2021-10-22 v7 机器学习
摘要
机器学习模型的黑盒性质阻碍了一些高精度模型在医学诊断中的部署。将生命托付于医学研究者未完全理解的模型是危险的。然而,通过模型解释,黑盒模型可迅速揭示医学从业者在 COVID-19 大流行感染患者激增时可能忽略的重要生物标志物。本研究利用 2020 年 1 月 18 日至 3 月 5 日中国珠海 92 名 SARS-CoV-2 实验室检测阳性患者的数据库,识别指示严重程度预测的生物标志物。通过对决策树、随机森林、梯度提升树和使用排列特征重要性、部分依赖图(PDP)、个体条件期望(ICE)、累积局部效应(ALE)、局部可解释模型无关解释(LIME)和沙普利加性解释(SHAP)的神经网络四种机器学习模型的解释,我们确定 N 端脑钠肽前体(NTproBNP)、C 反应蛋白(CRP)和乳酸脱氢酶(LDH)升高、淋巴细胞(LYM)降低与严重感染及死亡风险增加相关,这与近期 COVID-19 医学研究及其他使用专用模型的研究一致。我们进一步在来自巴西圣保罗 Hospital Israelita Albert Einstein、Kaggle 上含 5644 名确诊患者的大型开放数据集上验证方法,并揭示白细胞、嗜酸性粒细胞和血小板为 COVID-19 的三个指示性生物标志物。
引用
@article{arxiv.2010.02006,
title = {Interpretable Machine Learning for COVID-19: An Empirical Study on Severity Prediction Task},
author = {Han Wu and Wenjie Ruan and Jiangtao Wang and Dingchang Zheng and Bei Liu and Yayuan Gen and Xiangfei Chai and Jian Chen and Kunwei Li and Shaolin Li and Sumi Helal},
journal= {arXiv preprint arXiv:2010.02006},
year = {2021}
}
备注
Accepted by IEEE Transactions on Artificial Intelligence, 2021