中文

从大规模临床笔记语料库开发通用临床语言推断模型

计算与语言 2022-10-14 v1

摘要

若干生物医学语言模型已为临床语言推断而开发。然而,这些模型通常使用通用词表并在相对较小的临床语料上训练。我们试图评估使用领域特定词表与大规模临床训练语料对这些语言模型在临床语言推断中性能的影响。我们使用在加州大学旧金山分校(UCSF)撰写的7500万份去标识化临床笔记的多样化去标识化语料,训练了一个基于Transformer的双向编码器解码器(BERT)模型。我们在若干临床语言推断基准任务上评估该模型:临床与时间概念识别、关系抽取与医学语言推断。我们还使用UCSF出院小结在两个任务上评估我们的模型:诊断代码分配与治疗类别推断。我们的模型在公开基准任务上与可比规模的最佳公开生物医学语言模型表现相当,并在使用UCSF数据的两个任务的系统内评估中显著优于这些模型。领域词表的使用似乎改进了较长文档的编码。大规模临床语料的使用似乎增强了文档编码与推断准确性。然而,仍需进一步研究以改进缩写消解,以及数值、时间与隐式因果推断。

关键词

引用

@article{arxiv.2210.06566,
  title  = {Developing a general-purpose clinical language inference model from a large corpus of clinical notes},
  author = {Madhumita Sushil and Dana Ludwig and Atul J. Butte and Vivek A. Rudrapatna},
  journal= {arXiv preprint arXiv:2210.06566},
  year   = {2022}
}

备注

Under review