中文

UNITE:基于不确定性的多源数据健康风险预测模型

机器学习 2021-04-27 v2

摘要

成功的健康风险预测要求模型具备准确性与可靠性。现有预测模型主要依赖用先进深度学习技术挖掘电子健康记录(EHR)来提升模型精度。然而,它们都忽视了公开在线健康数据的重要性,尤其是各地区的社会经济地位、环境因素和详细人口统计信息,这些均为强预测信号,且必定能增强精准医疗。为实现模型可靠性,模型需提供准确的预测及其不确定性分数。但现有不确定性估计方法常难以处理多源数据中的高维数据。为弥补这一不足,我们提出基于不确定性的健康风险预测(UNITE)模型。基于自适应多模态深度核与随机变分推断模块,UNITE 利用多源健康数据(包括 EHR 数据、患者人口统计信息和从网络收集的公共健康数据)提供准确的疾病风险预测与不确定性估计。我们在真实世界疾病风险预测任务上评估 UNITE:非酒精性脂肪性肝病(NASH)与阿尔茨海默病(AD)。UNITE 在 AD 检测上 F1 分数达 0.841,在 NASH 检测上 PR-AUC 达 0.609,并以最高超出最佳基线 19%19\% 的优势优于多种 SOTA 基线。我们还展示 UNITE 能建模有意义的不确定性,并可通过聚类相似患者提供循证临床支持。

关键词

引用

@article{arxiv.2010.11389,
  title  = {UNITE: Uncertainty-based Health Risk Prediction Leveraging Multi-sourced Data},
  author = {Chacha Chen and Junjie Liang and Fenglong Ma and Lucas M. Glass and Jimeng Sun and Cao Xiao},
  journal= {arXiv preprint arXiv:2010.11389},
  year   = {2021}
}