中文

基于上下文词表示的临床命名实体识别

计算与语言 2021-06-25 v1 定量方法

摘要

临床命名实体识别(CNER)任务旨在将临床术语定位并分类为预定义类别,如诊断操作、疾病障碍、严重程度、药物、药物剂量和体征症状。CNER有助于研究药物副作用,包括识别新现象以及以人为中心的信息抽取。现有提取感兴趣实体的方法侧重于使用静态词嵌入来表示每个词。然而,一个词可能具有依赖于句子上下文的不同解释。显然,静态词嵌入不足以整合一词的多义解释。为克服这一挑战,上下文词嵌入技术被引入,以更好地根据其上下文捕捉每个词的语义。其中两种语言模型ELMo和Flair已广泛应用于自然语言处理领域,以在通用领域文档上生成上下文词嵌入。然而,这些嵌入通常过于通用,难以捕捉特定领域词汇间的邻近关系。为促进利用临床病例报告(CCRs)的各种下游应用,我们使用来自PubMed Central的临床相关语料库预训练了两个深度上下文语言模型:基于语言模型的临床嵌入(C-ELMo)和临床上下文字符串嵌入(C-Flair)。明确的实验表明,与静态词嵌入和通用领域语言模型相比,我们的模型取得了显著改进。

关键词

引用

@article{arxiv.2106.12608,
  title  = {Clinical Named Entity Recognition using Contextualized Token Representations},
  author = {Yichao Zhou and Chelsea Ju and J. Harry Caufield and Kevin Shih and Calvin Chen and Yizhou Sun and Kai-Wei Chang and Peipei Ping and Wei Wang},
  journal= {arXiv preprint arXiv:2106.12608},
  year   = {2021}
}

备注

1 figure, 6 tables