中文

先验自适应半监督学习及其在电子健康记录表型分型中的应用

统计方法学 2021-09-14 v2

摘要

电子健康记录(EHR)数据是生物医学研究的丰富来源,已成功用于对广泛疾病获得新见解。尽管潜力巨大,EHR因其缺乏精确表型信息这一主要局限而在发现研究中未得到充分利用。为克服此类困难,近期努力致力于开发有监督算法,以基于通过病历审查提取的带有金标准标签的相对较小训练数据集准确预测表型。然而,有监督方法通常需要相当规模的训练集以产生可泛化算法,尤其当候选特征数 pp 较大时。本文中,我们在高维设定下提出一种半监督(SS)EHR表型分型方法,其从以下两者借用信息:标签 YY 和特征集 XX 均被观测的小规模标注数据,以及仅观测到 XX 且对所有患者可用、可预测 YY 的替代变量 SS 的更大规模未标注数据。在一个 SS 仅通过 YYXX 相关并允许其近似成立的工作先验假设下,我们提出先验自适应半监督(PASS)估计量,其通过向先验下导出的方向收缩估计量来自适应地融入先验知识。我们推导了所提估计量的渐近理论,并通过模拟研究证明其优于现有估计量。该方法被应用于Partner's Healthcare的类风湿关节炎EHR表型分型研究。

关键词

引用

@article{arxiv.2003.11744,
  title  = {Prior Adaptive Semi-supervised Learning with Application to EHR Phenotyping},
  author = {Yichi Zhang and Molei Liu and Matey Neykov and Tianxi Cai},
  journal= {arXiv preprint arXiv:2003.11744},
  year   = {2021}
}