UBERT:一种用于 UMLS 元叙词表大规模同义预测的新型语言模型
计算与语言
2022-04-28 v1 人工智能
摘要
UMLS 元叙词表整合了 200 多个生物医学源词表。在元叙词表构建过程中,人类编辑在词汇相似度算法的辅助下,将同义词聚类为概念。这个过程容易出错且耗时。最近,一种深度学习模型(LexLM)被开发用于 UMLS 词汇对齐(UVA)任务。本文介绍了 UBERT,一种基于 BERT 的语言模型,它通过一个有监督的同义预测(SP)任务(取代了原始的下一句预测(NSP)任务)在 UMLS 术语上进行预训练。我们使用 UMLS 词汇对齐(UVA)任务评估了 UBERT 在 UMLS 元叙词表构建过程中的有效性。结果表明,UBERT 的性能优于 LexLM 以及基于生物医学的 BERT 模型。UBERT 性能的关键在于为其专门开发的同义预测任务、训练数据与 UVA 任务的紧密对齐,以及用于预训练 UBERT 的模型相似性。
引用
@article{arxiv.2204.12716,
title = {UBERT: A Novel Language Model for Synonymy Prediction at Scale in the UMLS Metathesaurus},
author = {Thilini Wijesiriwardene and Vinh Nguyen and Goonmeet Bajaj and Hong Yung Yip and Vishesh Javangula and Yuqing Mao and Kin Wah Fung and Srinivasan Parthasarathy and Amit P. Sheth and Olivier Bodenreider},
journal= {arXiv preprint arXiv:2204.12716},
year = {2022}
}