医疗数据的可解释多类分类
机器学习
2020-12-29 v1 性能
摘要
机器学习应用为医疗数据的二次分析带来了新见解。机器学习有助于开发新药、界定易患某些疾病的群体、识别许多常见疾病的预测因子。同时,机器学习结果依赖于诸多因素的交织,包括特征选择、类(不)平衡、算法偏好与性能度量。本文中,我们提出一个大型医疗数据集的可解释多类分类。我们详细讨论了基于知识的特征工程、数据集平衡、最佳模型选择与参数调优。本研究使用了六种算法:支持向量机(SVM)、朴素贝叶斯、梯度提升、决策树、随机森林与逻辑回归。我们的实证评估在 UCI Diabetes 130-US hospitals for years 1999-2008 数据集上进行,任务是将患者再入院住院时间分为三类:0 天、<30 天或 >30 天。我们的结果表明,在学习实验中使用 23 个用药特征改善了所应用的六种学习算法中五种算法的召回率(Recall)。这是扩展先前基于相同数据研究的新结果。梯度提升与随机森林在三分类准确率(Accuracy)方面优于其他算法。
引用
@article{arxiv.2012.13796,
title = {Explainable Multi-class Classification of Medical Data},
author = {YuanZheng Hu and Marina Sokolova},
journal= {arXiv preprint arXiv:2012.13796},
year = {2020}
}
备注
21 pages; 23 tables; 2 appendixes