中文

基于对患者重要性的电子健康记录笔记术语无监督集成排序

计算与语言 2017-03-28 v2

摘要

背景:电子健康记录(EHR)笔记包含大量医学术语,患者可能难以理解。帮助患者的一种方式是为减少信息过载,并帮助他们关注对自己最重要的医学术语。目的:本工作的目标是开发FIT(为患者发现重要术语),一个无监督自然语言处理(NLP)系统,基于对患者的重要性对EHR笔记中的医学术语进行排序。方法:我们构建FIT基于一种新的无监督集成排序模型,该模型源自有偏随机游走算法,以结合异构信息资源对来自每篇EHR笔记的候选术语进行排序。具体而言,FIT集成了四个术语重要性的单一视图:患者对医学概念的使用、文档级术语显著性、基于词出现的术语相关性以及主题连贯性。它还结合了由术语的陌生程度和语义类型所传达的术语重要性的部分信息。我们在90篇专家标注的EHR笔记上评估了FIT,并将其与三种基准无监督集成排序方法进行比较。结果:FIT在从EHR笔记中排序候选术语以识别重要术语方面实现了0.885的AUC-ROC。当包含术语识别时,FIT从EHR笔记中识别重要术语的性能为0.813 AUC-ROC。它在大多数指标上优于三种集成排序器。其性能对其参数相对不敏感。结论:FIT可自动识别对患者重要的EHR术语,并可能有助于开发个性化干预措施以改善护理质量。通过使用无监督学习以及用于信息融合的鲁棒且灵活的框架,FIT可容易地应用于其他领域和应用。

关键词

引用

@article{arxiv.1703.00538,
  title  = {Unsupervised Ensemble Ranking of Terms in Electronic Health Record Notes Based on Their Importance to Patients},
  author = {Jinying Chen and Hong Yu},
  journal= {arXiv preprint arXiv:1703.00538},
  year   = {2017}
}