面向生物医学概念规范化的跨语言候选搜索
计算与语言
2018-07-10 v1
摘要
生物医学概念规范化将文本中的概念提及链接到生物医学知识库中语义等价的概念。该任务具有挑战性,因为概念在自然语言中可能具有不同表达,例如释义,而这些表达未必都存在于知识库中。非英语生物医学文本的概念规范化更具挑战性,因为非英语资源往往规模小得多且包含更少的同义词。为克服非英语术语资源的局限性,我们提出一种利用基于字符的神经翻译模型(该模型在 multilingual 生物医学术语上训练)进行概念规范化的跨语言候选搜索。我们的模型使用UMLS的西班牙语、法语、荷兰语和德语版本训练。模型在French Quaero语料上的评估表明其优于CLEF eHealth 2015和2016的大多数团队。此外,我们在Mantra的西班牙语、法语、荷兰语和德语版本上将其性能与商业翻译器比较。我们的模型表现同样良好,但免费且可本地运行。这对于临床NLP应用尤为重要,因为医疗文档受严格的隐私限制。
引用
@article{arxiv.1805.01646,
title = {Cross-lingual Candidate Search for Biomedical Concept Normalization},
author = {Roland Roller and Madeleine Kittner and Dirk Weissenborn and Ulf Leser},
journal= {arXiv preprint arXiv:1805.01646},
year = {2018}
}