中文

释放电子健康记录中的回顾性患病信息——一种成对伪似然方法

统计方法学 2024-11-19 v1

摘要

通常,电子健康记录数据并非针对特定研究问题收集,而是包含在各自不同年龄招募的大量个体,其医学、环境且往往还有遗传数据被采集。某些表型(如发病年龄)若在招募前已发生则可回顾性报告,此类观察称为“患病”观察。容纳这种“延迟进入”的标准方法以招募前全部历史为条件,因此回顾性患病失效时间被条件化而不能参与发病年龄分布的估计。另一种方法仅以存活至招募年龄及招募年龄本身为条件。该方法允许纳入患病信息,但带来数值与计算困难。本文中,我们在利用患病数据的同时,发展了发病年龄回归模型中系数的一致估计量。给出了渐近结果,并开展模拟以展示所提方法可能获得的显著效率提升。特别地,该方法在利用大规模数据库进行遗传变异可重复性分析时极为有用。事实上,对膀胱癌数据的分析显示,相比流行方法,所提方法产生的可重复发现约为两倍。

关键词

引用

@article{arxiv.2309.01128,
  title  = {Unlocking Retrospective Prevalent Information in EHRs -- a Pairwise Pseudolikelihood Approach},
  author = {Nir Keret and Malka Gorfine},
  journal= {arXiv preprint arXiv:2309.01128},
  year   = {2024}
}