中文

用于电子病历数据中罕见结局分类的代理变量引导抽样设计

统计方法学 2020-11-09 v2

摘要

将机器学习应用于电子病历(EMR)系统,已能够实现可扩展且准确的特定临床结局识别。分类模型的开发需要收集完整的标注数据集,其中真实临床结局由人类专家人工审阅获得。例如,自然语言处理算法的开发需要抽取临床文本数据以获取训练模型所需的结局信息。然而,若结局罕见,则简单随机抽样所得病例极少,信息不足以开发准确的分类器。由于大规模详细抽取通常昂贵、耗时且不可行,亟需更高效的策略。在此类资源受限情形下,我们提出一类富集抽样设计,其中抽取以与真实感兴趣结局相关的辅助变量进行分层。对高特异性变量进行分层抽样可得到更富含病例的有针对性样本,我们证明这转化为模型判别力的提升与更好的统计学习性能。我们给出数学细节,并提供将抽样设计与其所得预测模型性能相关联的仿真证据。我们讨论了所提抽样对模型训练与验证的影响。最后,我们利用 Lumbar Imaging with Reporting of Epidemiology(LIRE)研究的放射报告文本数据,阐明所提设计在结局标签收集及后续机器学习中的应用。

关键词

引用

@article{arxiv.1904.00412,
  title  = {Surrogate-guided sampling designs for classification of rare outcomes from electronic medical records data},
  author = {W. Katherine Tan and Patrick J. Heagerty},
  journal= {arXiv preprint arXiv:1904.00412},
  year   = {2020}
}