中文

面向电子健康档案自然语言处理改进的相关词序向量化

计算与语言 2018-12-10 v1 计算机与社会

摘要

目的:电子健康档案(EHR)是开展观察性研究、支持临床试验等工作的丰富资源。然而,许多相关信息以非结构化格式存储,难以利用。试图自动分类数据的自然语言处理方法依赖于对文本施加结构的向量化算法,但这些算法并非针对 EHR 的独特特征而设计。在此,我们提出一种用于结构化所谓自由文本的新算法,可帮助研究者更好地利用 EHR。我们称此方法为相关词序向量化(RWOV)。材料与方法:作为概念验证,我们尝试从病理报告的非结构化文本中,分类堪萨斯大学医学中心近年收治的乳腺癌患者的激素受体状态。我们的方法试图考虑医疗提供者常输入信息的半结构化方式。我们将此方法与时序词袋(ngrams)及 word2vec 方法进行比较。结果:如以 F1 分数和受试者工作特征曲线下面积(AUC)衡量,我们的方法取得了最稳定的一致高准确率。讨论:我们的结果表明,考虑上下文的自由文本结构化方法可能表现出更优性能,且我们的方法颇具前景。结论:通过使用一种考虑到医疗提供者倾向于重复某些关键词且这些关键词的顺序十分重要的方法,我们展示了相较未考虑此点的方法的性能提升。

关键词

引用

@article{arxiv.1812.02627,
  title  = {Relevant Word Order Vectorization for Improved Natural Language Processing in Electronic Healthcare Records},
  author = {Jeffrey Thompson and Jinxiang Hu and Dinesh Pal Mudaranthakam and David Streeter and Lisa Neums and Michele Park and Devin C. Koestler and Byron Gajewski and Matthew S. Mayo},
  journal= {arXiv preprint arXiv:1812.02627},
  year   = {2018}
}