多本体精炼嵌入(MORE):一种用于生物医学概念、融合多本体与语料的混合语义表示
计算与语言
2020-04-15 v1
摘要
目的:当前临床应用中自然语言处理(NLP)分析的一个主要局限是,一个概念在不同文本中可以以多种形式被引用。本文介绍多本体精炼嵌入(MORE),一种将来自多个本体的领域知识融入从临床文本语料库学习到的分布语义模型中的新型混合框架。材料与方法:我们使用 RadCore 与 MIMIC-III 自由文本数据集作为 MORE 的语料库部分。对于基于本体的部分,我们使用医学主题词表(MeSH)本体与三种最先进的基于本体的相似度度量。在我们的方法中,我们提出了一种从 Sigmoid 交叉熵目标函数修改而来的新学习目标。结果与讨论:我们使用两个已确立的生物医学概念对语义相似度数据集来评估所生成词嵌入的质量。在包含 29 对概念的第一个数据集上,其相似度分数由医师与医学编码员确立,MORE 的相似度分数具有最高的综合相关性(0.633),比基线模型高 5.0%,比最佳的基于本体的相似度度量高 12.4%。在包含 449 对概念的第二个数据集上,MORE 的相似度分数与四位医学住院医师相似度评分的平均值相关性为 0.481,优于 skip-gram 模型 8.1%,优于最佳本体度量 6.9%。
引用
@article{arxiv.2004.06555,
title = {Multi-Ontology Refined Embeddings (MORE): A Hybrid Multi-Ontology and Corpus-based Semantic Representation for Biomedical Concepts},
author = {Steven Jiang and Weiyi Wu and Naofumi Tomita and Craig Ganoe and Saeed Hassanpour},
journal= {arXiv preprint arXiv:2004.06555},
year = {2020}
}