MedJEx:一种利用维基超链接跨度与上下文化掩码语言模型分数的医学术语提取模型
计算与语言
2022-10-13 v1
摘要
本文提出了一种用于从电子健康记录(EHR)笔记中识别患者可能难以理解的医学术语的自然语言处理(NLP)新应用。我们首先呈现了一个新颖且公开可用的数据集,包含来自 18K+ 条 EHR 笔记句子的专家标注医学术语()。随后,我们引入了一种新颖的医学术语提取()模型,其已被证明优于现有最优 NLP 模型。首先,MedJEx 在辅助的 Wikipedia 超链接跨度数据集上训练时整体性能提升,其中超链接跨度为这些跨度(或术语)提供了额外的 Wikipedia 文章进行解释,随后在标注的 MedJ 数据上微调。其次,我们发现上下文化掩码语言模型分数有益于检测领域特定的陌生术语。此外,我们的结果显示,在辅助 Wikipedia 超链接跨度数据集上训练提升了八个生物医学命名实体识别基准数据集中的六个。MedJ 与 MedJEx 均公开可用。
引用
@article{arxiv.2210.05875,
title = {MedJEx: A Medical Jargon Extraction Model with Wiki's Hyperlink Span and Contextualized Masked Language Model Score},
author = {Sunjae Kwon and Zonghai Yao and Harmon S. Jordan and David A. Levy and Brian Corner and Hong Yu},
journal= {arXiv preprint arXiv:2210.05875},
year = {2022}
}
备注
Accepted to EMNLP 22