中文

通过先验知识引导的电子健康记录表型发现

应用统计 2025-11-05 v1 机器学习

摘要

目标:在电子健康记录 (EHR) 数据上进行的无监督学习已显示出用于表型发现的潜力,但通常忽略既有临床信息,这限制了可解释性。我们将贝叶斯潜类框架用于表型分层,纳入特定领域的知识以提高 EHR 派生表型的临床可解释性,并通过识别以 Type 2 (T2) 炎症特征为特征的哮喘亚表型来说明其实用性。材料与方法:我们说明了将临床知识整合到贝叶斯潜类模型中的框架,通过信息性先验引导无监督聚类以导向临床相关的亚组。该方法建模了缺失情况,accounting for 潜在的非随机缺失模式,并提供患者水平的表型分配概率及其不确定性。使用可重复且灵活的代码,我们将该模型应用于大型哮喘 EHR 队列中,指定 T2 炎症相关特征的 information 先验和其他临床变量的弱信息先验,让数据来指导后验分布。结果与结论:使用 2017 年 1 月至 2024 年 2 月的接触数据,我们发现表型分配的后验分布呈双峰分布,表明类别清晰分离。T2 炎症信息性类 (38.7%) 以升高的嗜酸粒细胞水平和过敏标记物为特征,以及高医疗保健利用和药物使用,尽管其他变量仅使用弱信息先验。这些模式暗示了一个“控制不佳的 T2-high”亚表型。这表明我们的贝叶斯潜类建模方法支持在无明确表型定义的异构疾病的 EHR-based 研究中进行假设生成和队列识别。

关键词

引用

@article{arxiv.2511.02102,
  title  = {Enhancing Phenotype Discovery in Electronic Health Records through Prior Knowledge-Guided Unsupervised Learning},
  author = {Melanie Mayer and Kimberly Lactaoen and Gary E. Weissman and Blanca E. Himes and Rebecca A. Hubbard},
  journal= {arXiv preprint arXiv:2511.02102},
  year   = {2025}
}

备注

Submitted to JAMIA; preprint is the author's original version. Github repo: https://github.com/mm4963/prior-guided-EHR-phenotyping/tree/main