中文

UmlsBERT:利用统一医学语言系统元词表对上下文嵌入进行临床领域知识增强

计算与语言 2021-06-04 v5 人工智能 机器学习

摘要

上下文词嵌入模型,如 BioBERT 与 Bio_ClinicalBERT,通过将预训练过程聚焦于特定领域语料,已在生物医学自然语言处理任务中取得最先进结果。然而,此类模型未考虑专家领域知识。本工作中,我们提出 UmlsBERT,一种在预训练过程中通过新颖知识增强策略整合领域知识的上下文嵌入模型。更具体地,利用统一医学语言系统(UMLS)元词表对 UmlsBERT 的增强以两种方式执行:i) 连接 UMLS 中具有相同底层“概念”的词,以及 ii) 利用 UMLS 中的语义组知识创建具有临床意义的输入嵌入。通过应用这两种策略,UmlsBERT 能将临床领域知识编码进词嵌入,并在常见的命名实体识别(NER)与临床自然语言推断等临床 NLP 任务上优于现有领域特定模型。

关键词

引用

@article{arxiv.2010.10391,
  title  = {UmlsBERT: Clinical Domain Knowledge Augmentation of Contextual Embeddings Using the Unified Medical Language System Metathesaurus},
  author = {George Michalopoulos and Yuanxin Wang and Hussam Kaka and Helen Chen and Alexander Wong},
  journal= {arXiv preprint arXiv:2010.10391},
  year   = {2021}
}

备注

10 pages, 3 figures, accepted in NAACL 2021