中文

使用国际疾病分类代码作为协变量的高斯过程回归与分类

统计方法学 2021-08-05 v1 应用统计

摘要

国际疾病分类(ICD)代码广泛用于编码电子健康记录(EHR)中的诊断。多年来,已开发出自动化方法,利用EHR在诊断相似的患者之间借用信息来预测生物医学响应。相对而言,较少关注开发能够建模ICD代码结构和多种慢性病存在的患者相似性度量,其中慢性病定义为一组ICD代码。受此问题启发,我们首先开发了一种字符串核函数,用于测量一对ICD代码子集之间的相似性,该函数使用了慢性病的定义。其次,我们将此相似性度量扩展,定义了一族基于ICD代码子集的协方差函数。利用这一族函数,我们开发了高斯过程(GP)先验,用于使用诊断和其他人口统计信息作为协变量的贝叶斯非参数回归和分类。马尔可夫链蒙特卡洛(MCMC)算法用于后验推断和预测。所提出的方法无需任何调优参数,非常适合自动预测依赖于慢性病的连续和分类生物医学响应。我们在爱荷华大学医院和诊所(UIHC)收集的1660名患有六种不同原发癌部位患者的EHR数据上评估了我们方法的实际性能。在分类不同原发癌部位方面,我们的方法比其竞争对手具有更好的敏感性和特异性,并估计了慢性病与原发癌部位之间的边际关联。

关键词

引用

@article{arxiv.2108.01813,
  title  = {Gaussian Process Regression and Classification using International Classification of Disease Codes as Covariates},
  author = {Sanvesh Srivastava and Zongyi Xu and Yunyi Li and W. Nick Street and Stephanie Gilbertson-White},
  journal= {arXiv preprint arXiv:2108.01813},
  year   = {2021}
}

备注

8 tables, 1 figure