无标注的零样本医学实体检索:从丰富知识图谱语义中学习
计算与语言
2021-05-27 v1 人工智能
摘要
医学实体检索是理解和跨各类卫生系统交流信息的核心组成部分。当前方法往往在特定医学领域表现良好,但对未见亚专科的泛化能力差。在公共卫生危机下,新医学条件和药物治疗频繁出现,这日益令人担忧。由于医学语料的高度模糊性和多变性,零样本检索具有挑战性,难以在提及与概念间建立准确的相似度度量。然而,医学知识图谱(KG)包含丰富语义,包括大量同义词及其精心构建的图结构。为利用这一有价值的信息,我们提出了一套专为训练高效零样本实体检索模型而设计的学习任务。在无需任何人工标注的情况下,我们的知识图谱增强架构显著优于常见零样本基准,包括 BM25 和 Clinical BERT,在 UMLS、SNOMED 和 ICD-10 等多个主要医学本体上召回率高出 7% 至 30%。
引用
@article{arxiv.2105.12682,
title = {Zero-shot Medical Entity Retrieval without Annotation: Learning From Rich Knowledge Graph Semantics},
author = {Luyang Kong and Christopher Winestock and Parminder Bhatia},
journal= {arXiv preprint arXiv:2105.12682},
year = {2021}
}