面向生物医学实体表示的自我对齐预训练
计算与语言
2021-04-08 v2 人工智能
机器学习
摘要
尽管基于掩码语言模型(MLM)的自监督学习已取得广泛成功,在生物医学领域精准捕捉细粒度语义关系仍具挑战。这对实体级任务(如实体链接)至关重要,其中建模实体关系(尤其是同义关系)的能力举足轻重。为应对此挑战,我们提出SapBERT,一种自我对齐生物医学实体表示空间的预训练方案。我们设计了一个可扩展的度量学习框架,能利用UMLS——一个含400万以上概念的生物医学本体海量集合。与以往基于流水线的混合系统不同,SapBERT为医学实体链接(MEL)问题提供了优雅的“一模型通用”解法,在六个MEL基准数据集上达到新的最先进水平(SOTA)。在科学领域,即便无任务特定监督我们也实现了SOTA。相较BioBERT、SciBERT与PubMedBERT等多种领域特定预训练MLM的显著提升,证明我们的预训练方案既有效又鲁棒。
引用
@article{arxiv.2010.11784,
title = {Self-Alignment Pretraining for Biomedical Entity Representations},
author = {Fangyu Liu and Ehsan Shareghi and Zaiqiao Meng and Marco Basaldella and Nigel Collier},
journal= {arXiv preprint arXiv:2010.11784},
year = {2021}
}
备注
NAACL 2021 camera-ready version