一种测量生物医学概念语义相关性的混合方法
计算与语言
2021-01-26 v1
摘要
目的:本工作旨在证明基于 Sentence BERT 模型与改造(retrofitting)算法的混合方法在计算任意两个生物医学概念间相关性的有效性。材料与方法:我们通过使用 ELMo、BERT 与 Sentence BERT 模型编码概念首选词项来生成概念向量。我们使用了 BioELMo 与 Clinical ELMo。我们使用了无本体知识(OKF)模型如 PubMedBERT、BioBERT、BioClinicalBERT,以及有本体知识注入(OKI)模型如 SapBERT、CoderBERT、KbBERT 与 UmlsBERT。我们在 SNLI 与 STSb 数据集上利用连体网络训练所有 BERT 模型,使模型在短语或句子层面学习更多语义信息,从而更好地表示多词概念。最后,为将本体关系知识注入概念向量,我们使用改造算法及来自多种 UMLS 关系的概念。我们在四个公开可用数据集上评估了我们的混合方法,其中包括最近发布的 EHR-RelB 数据集。EHR-RelB 是最大的公开可用相关性数据集,其中 89% 的术语为多词,使其更具挑战性。结果:Sentence BERT 模型大多优于对应的 BERT 模型。基于 SapBERT 的 Sentence BERT 模型生成并用 UMLS 相关概念改造的概念向量在所有四个数据集上取得最佳结果。结论:在大多数情况下,Sentence BERT 模型比 BERT 模型更有效地计算相关性分数。将本体知识注入概念向量进一步提升了其质量并有助于更好的相关性分数。
引用
@article{arxiv.2101.10196,
title = {A Hybrid Approach to Measure Semantic Relatedness in Biomedical Concepts},
author = {Katikapalli Subramanyam Kalyan and Sivanesan Sangeetha},
journal= {arXiv preprint arXiv:2101.10196},
year = {2021}
}
备注
preprint under review