在 UMLS 元词典中大规模评估生物医学 BERT 模型用于词汇对齐
计算与语言
2021-10-18 v2
摘要
当前 UMLS(统一医学语言系统)元词典整合超过 200 个生物医学源词汇的构建过程昂贵且易出错,因为它依赖词汇算法和人类编辑来决定两个生物医学术语是否同义。自然语言处理的最新进展,如具有上下文词嵌入的 Transformer 模型 BERT 及其生物医学变体,已在下游任务上取得最先进(SOTA)性能。我们旨在验证这些使用 BERT 模型的方法是否确实能超越现有方法,用于预测 UMLS 元词典中的同义关系。在现有的带 LSTM 和 BioWordVec 嵌入的孪生网络中,我们将 BioWordVec 嵌入替换为从不同 BERT 模型以不同提取方式提取的生物医学 BERT 嵌入。在 Transformer 架构中,我们评估了使用不同数据集和任务预训练的不同生物医学 BERT 模型。鉴于这些 BERT 模型在其他下游任务的 SOTA 性能,我们的实验得出了令人惊讶的有趣结果:(1)在两种模型架构中,采用这些基于生物医学 BERT 的方法均未超越使用带 BioWordVec 嵌入的孪生网络的现有方法用于 UMLS 同义预测任务;(2)未经 UMLS 预训练的原始 BioBERT large 模型优于经 UMLS 预训练的 SapBERT 模型;(3)与使用生物医学 BERT 模型相比,使用孪生网络在同义预测上取得了更好的性能。
引用
@article{arxiv.2109.13348,
title = {Evaluating Biomedical BERT Models for Vocabulary Alignment at Scale in the UMLS Metathesaurus},
author = {Goonmeet Bajaj and Vinh Nguyen and Thilini Wijesiriwardene and Hong Yung Yip and Vishesh Javangula and Srinivasan Parthasarathy and Amit Sheth and Olivier Bodenreider},
journal= {arXiv preprint arXiv:2109.13348},
year = {2021}
}