NILE:面向电子健康记录的快速自然语言处理
计算与语言
2019-07-17 v5
摘要
目标:电子健康记录(EHR)中的叙述性文本包含了丰富的医学和数据科学研究信息。本文介绍了“叙述信息线性提取”(NILE)的设计与性能,这是一个用于 EHR 分析的自然语言处理(NLP)软件包,我们将与医学信息学社区共享。方法:NILE 使用一种改进的前缀树搜索算法进行命名实体识别,该算法能够检测前缀和后缀共享。语义分析通过基于规则的有限状态机实现。分析内容包括否定、位置、修饰、家族史以及忽略项。结果:NILE 的处理速度比现有的医学文本 NLP 软件快数百至数千倍。在 2010 年 i2b2/VA NLP 挑战数据上,NILE 的存在性分析准确率与表现最佳的模型相当。结论:NILE 凭借其速度、准确性以及通过 API 运行的能力,成为医学信息学和数据科学领域 NLP 软件的重要补充。
引用
@article{arxiv.1311.6063,
title = {NILE: Fast Natural Language Processing for Electronic Health Records},
author = {Sheng Yu and Tianrun Cai and Tianxi Cai},
journal= {arXiv preprint arXiv:1311.6063},
year = {2019}
}