生物医学中的自然语言处理:统一系统架构概述
计算与语言
2014-08-10 v2
摘要
在现代电子病历(EMR)中,许多具有临床重要性的数据——如体征与症状、症状严重程度、疾病状态等——并未提供于结构化数据字段中,而是编码在临床医生生成的叙述性文本里。自然语言处理(NLP)为“解锁”这一重要数据源提供了手段,以应用于临床决策支持、质量保证和公共卫生领域。本章基于统一的架构视角,概述了生物医学中具有代表性的 NLP 系统。NLP 系统的一般架构由两个主要部分组成:包括生物医学知识资源的背景知识,以及整合 NLP 工具以处理文本的框架。系统在这两个组成部分上均存在差异,我们将对此进行简要回顾。此外,当前生物医学 NLP 研究工作面临的挑战包括缺乏大型公开可用的标注语料库,尽管促进数据共享、系统评估以及临床 NLP 研究人员之间协作的倡议正在兴起。
引用
@article{arxiv.1401.0569,
title = {Natural Language Processing in Biomedicine: A Unified System Architecture Overview},
author = {Son Doan and Mike Conway and Tu Minh Phuong and Lucila Ohno-Machado},
journal= {arXiv preprint arXiv:1401.0569},
year = {2014}
}
备注
25 pages, 5 figures, book chapter in Clinical Bioinformatics, 2014, edited by Ronand Trent