中文

CREATE:基于 OMOP 通用数据模型对电子健康记录文本进行分析以增强的队列检索

信息检索 2021-06-15 v1

摘要

背景:电子健康记录(EHR)的广泛采用使得 EHR 数据能够被二次利用于临床研究与医疗交付。自然语言处理(NLP)技术在从非结构化临床数据中提取嵌入信息方面已展现出潜力,而信息检索(IR)技术提供了灵活且可扩展的解决方案,可增强 NLP 系统以检索和排序相关记录。方法:本文提出基于 EHR 文本分析增强的队列检索系统(CREATE,Cohort Retrieval Enhanced by Analysis of Text from EHRs)的实现,该系统可在结构化和非结构化 EHR 数据上执行文本队列选择查询。CREATE 是一个概念验证系统,它结合结构化查询与基于 NLP 结果的 IR 技术来提升队列检索性能,同时采用观察性医疗结局合作组织(OMOP)通用数据模型(CDM)以增强模型可移植性。由 cTAKES 赋能的 NLP 组件用于从文本查询中提取 CDM 概念。我们在 Elasticsearch 中设计了一种分层索引,以利用 IR 技术和框架支持 CDM 概念搜索。结果:我们在 5 个队列识别查询上的案例研究使用 IR 指标 P@5(前 5 精确率)在患者级和文档级进行评估,表明 CREATE 达到了 0.90 的平均 P@5,优于仅使用结构化数据或仅使用非结构化数据的系统,其平均 P@5 分别为 0.54 和 0.74。

关键词

引用

@article{arxiv.1901.07601,
  title  = {CREATE: Cohort Retrieval Enhanced by Analysis of Text from Electronic Health Records using OMOP Common Data Model},
  author = {Sijia Liu and Yanshan Wang and Andrew Wen and Liwei Wang and Na Hong and Feichen Shen and Steven Bedrick and William Hersh and Hongfang Liu},
  journal= {arXiv preprint arXiv:1901.07601},
  year   = {2021}
}