中文

面向临床文本概念抽取的有效特征表示

计算与语言 2019-04-09 v2

摘要

关于医疗实践的关键信息仅以自由文本形式记录,这为高影响力的自然语言处理(NLP)创造了巨大机遇。然而,带标注的医疗数据集往往规模小且获取成本高,这就提出了如何最大化利用可用数据的问题。为此,我们开发了一种 LSTM-CRF 模型,用于结合无监督词表示与基于公开医疗本体构建的手工特征表示。我们表明,该组合模型在五类不同性质的医疗文本(临床、社交、科学、商业)数据集上均取得了更优性能。每个数据集都涉及对挑选出不同医疗概念的复杂多词跨度的标注。我们还引入了一个用于识别药物与疾病之间治疗关系的全新标注数据集。

关键词

引用

@article{arxiv.1811.00070,
  title  = {Effective Feature Representation for Clinical Text Concept Extraction},
  author = {Yifeng Tao and Bruno Godefroy and Guillaume Genthial and Christopher Potts},
  journal= {arXiv preprint arXiv:1811.00070},
  year   = {2019}
}