用于生物医学领域语义相似度估计的神经句子嵌入模型
计算与语言
2021-11-01 v1
摘要
背景:在本研究中,我们探究了当前最先进的神经句子嵌入模型在生物医学文献句子语义相似度估计中的有效性。我们在PubMed开放获取数据集的170万篇文章上训练了不同的神经嵌入模型,并基于一个包含100个由人类专家标注的句子对的生物医学基准集以及从原始基准集衍生出的一个较小的矛盾子集对它们进行了评估。结果:基于段落向量分布式记忆算法的最佳无监督模型取得了0.819的皮尔逊相关系数,超越了之前在BIOSSES生物医学基准集上取得的最先进结果。此外,我们提出的将不同基于字符串的相似度度量与神经嵌入模型相结合的监督模型,在生物医学基准集上的皮尔逊r值(r=0.871)超越了先前依赖本体的监督式最先进方法。与原始基准集上的良好结果形成对比,我们发现最佳模型在较小的矛盾子集上表现不佳。结论:在本研究中,我们通过展示基于神经网络的模型在生物医学领域语义相似度估计中能够跟上甚至超越先前依赖精心整理的本体的最先进方法(在生物医学基准集上评估时),凸显了其价值。然而,捕捉生物医学句子中的矛盾和否定成为进一步研究的关键领域。
引用
@article{arxiv.2110.15708,
title = {Neural sentence embedding models for semantic similarity estimation in the biomedical domain},
author = {Kathrin Blagec and Hong Xu and Asan Agibetov and Matthias Samwald},
journal= {arXiv preprint arXiv:2110.15708},
year = {2021}
}
备注
Abstract shortened to comply with arXiv guidelines