利用机器学习技术识别糖尿病与未确诊糖尿病的关键风险因素
机器学习
2021-05-21 v1
摘要
本文回顾了广泛选取的机器学习模型,这些模型利用八年期的国家健康与营养检查调查(NHANES)数据来预测糖尿病的存在与未确诊糖尿病的存在。模型通过其Brier分数进行调参与比较。随后比较了性能最佳模型中最为相关的变量。具有线性核的支持向量机在预测糖尿病上表现最佳,在测试集上返回Brier分数0.0654与AUROC 0.9235。弹性网络回归在预测未确诊糖尿病上表现最佳,测试集上Brier分数0.0294、AUROC 0.9439。两组模型中相似特征均显著出现。血液渗透压、家族史、多种化合物的普遍程度以及高血压是所有糖尿病风险的关键指标。尤其对于未确诊糖尿病,种族或遗传成分作为强相关因素浮现。
引用
@article{arxiv.2105.09379,
title = {Using Machine Learning Techniques to Identify Key Risk Factors for Diabetes and Undiagnosed Diabetes},
author = {Avraham Adler},
journal= {arXiv preprint arXiv:2105.09379},
year = {2021}
}