中文

面向生物医学实体表示的自我对齐预训练

计算与语言 2021-04-08 v2 人工智能 机器学习

摘要

尽管基于掩码语言模型(MLM)的自监督学习已取得广泛成功,在生物医学领域精准捕捉细粒度语义关系仍具挑战。这对实体级任务(如实体链接)至关重要,其中建模实体关系(尤其是同义关系)的能力举足轻重。为应对此挑战,我们提出SapBERT,一种自我对齐生物医学实体表示空间的预训练方案。我们设计了一个可扩展的度量学习框架,能利用UMLS——一个含400万以上概念的生物医学本体海量集合。与以往基于流水线的混合系统不同,SapBERT为医学实体链接(MEL)问题提供了优雅的“一模型通用”解法,在六个MEL基准数据集上达到新的最先进水平(SOTA)。在科学领域,即便无任务特定监督我们也实现了SOTA。相较BioBERT、SciBERT与PubMedBERT等多种领域特定预训练MLM的显著提升,证明我们的预训练方案既有效又鲁棒。

关键词

引用

@article{arxiv.2010.11784,
  title  = {Self-Alignment Pretraining for Biomedical Entity Representations},
  author = {Fangyu Liu and Ehsan Shareghi and Zaiqiao Meng and Marco Basaldella and Nigel Collier},
  journal= {arXiv preprint arXiv:2010.11784},
  year   = {2021}
}

备注

NAACL 2021 camera-ready version