中文

广义线性混合模型分层似然的高性能实现:在海量电子健康记录数据集中估计钾参考范围的应用

应用统计 2021-04-20 v4

摘要

将电子健康记录 (EHR) 条目转化为有用的临床推断,需要解决现有广义线性混合模型 (GLMM) 针对重复测量的实现可扩展性差的问题。主要的计算瓶颈涉及积分的数值求值,即便是最简单的 EHR 分析也可能涉及数百万维(每位患者一维)。GLMM 的分层似然 (h-lik) 方法是一种基于拉普拉斯近似 (LA) 的 GLMM 估计框架,其以数值优化替代积分,因而随维度扩展性极好。我们在 R 包 TMB 中给出了 GLMM 的 h-lik 高性能实现。利用该方法,我们考察了 Cerner Real World Data (CRWD) EHR 数据库中血清钾测量值与生存的关系。分析该数据需要求值一个超过 300 万维的积分。我们还评估了 LA 在完整数据集 1% 和 10% 规模较小样本中的可扩展性与准确性,这些样本通过以下方法分析:a) 原始的、互联的广义线性模型 (iGLM) 的 h-lik 方法,b) 自适应高斯埃尔米特 (AGH),以及 c) 多元积分的黄金标准马尔可夫链蒙特卡洛 (MCMC)。LA 生成的随机效应估计与 iGLM、AGH 和 MCMC 技术所得值在 10% 以内。H-lik 方法比 AGH 快 4–30 倍,比 MCMC 快近 800 倍。我们发现 LA 与 AD 的结合通过 GLMM 的 h-lik 方法为分析极大规模真实世界重复测量数据提供了计算高效、数值准确的途径。我们分析所得的临床推断可指导临床中治疗钾紊乱的阈值选择。

关键词

引用

@article{arxiv.1910.08179,
  title  = {High Performance Implementation of the Hierarchical Likelihood for Generalized Linear Mixed Models. An Application to estimate the potassium reference range in massive Electronic Health Records datasets},
  author = {Cristian H Bologa and Vernon Shane Pankratz and Mark L Unruh and Maria Eleni Roumelioti and Vallabh Shah and Saeed Kamran Shaffi and Soraya Arzhan and John Cook and Christos Argyropoulos},
  journal= {arXiv preprint arXiv:1910.08179},
  year   = {2021}
}