中文

用于从电子健康记录生成大规模肿瘤学队列的带偏见分析的模型辅助队列选择

计算机与社会 2020-01-28 v1 机器学习

摘要

目的:电子健康记录(EHR)是肿瘤学健康结局研究中有前景的数据来源。使用EHR数据的挑战在于,选择患者队列常需要记录中非结构化部分的信息。机器学习已被用于解决此问题,但即便高性能算法也可能以非随机方式选择患者并使所得队列产生偏倚。为在衡量潜在偏倚的同时提高队列选择效率,我们引入一种称为带偏见分析的模型辅助队列选择(MACS)的技术,并将其应用于转移性乳腺癌(mBC)患者的选择。材料与方法:我们使用词频-逆文档频率(TF-IDF)与逻辑回归在17,263名患者上训练模型。我们使用17,292名患者的测试集衡量算法性能并进行偏见分析。我们将MACS生成的队列与无MACS本将生成的队列作为参考标准进行比较,先通过比较一组广泛的临床与人口统计学变量分布,再通过比较针对已有示例研究问题的两项分析结果。结果:我们的算法曲线下面积(AUC)为0.976,灵敏度为96.0%,抽象效率提升77.9%。在偏见分析中,我们发现基线特征无大差异,且示例分析无差异。结论:带偏见分析的MACS可显著提升EHR数据队列选择效率,同时让人确信在该所得队列上进行的结局研究不会偏倚。

关键词

引用

@article{arxiv.2001.09765,
  title  = {Model-assisted cohort selection with bias analysis for generating large-scale cohorts from the EHR for oncology research},
  author = {Benjamin Birnbaum and Nathan Nussbaum and Katharina Seidl-Rathkopf and Monica Agrawal and Melissa Estevez and Evan Estola and Joshua Haimson and Lucy He and Peter Larson and Paul Richardson},
  journal= {arXiv preprint arXiv:2001.09765},
  year   = {2020}
}

备注

Word count: Abstract, 254; text, 3934 Keywords: electronic health record; machine learning; cancer; real-world evidence