从大型本体中低资源识别与链接生物医学概念
计算与语言
2021-07-05 v2
摘要
探索科学文献的工具对科学家至关重要,尤其在生物医学领域,每年约发表一百万篇新论文。许多此类工具通过追踪论文中特定实体(如蛋白质、疾病)的提及,为用户提供搜索这些实体的能力。最著名的生物医学论文数据库PubMed依赖人工标注者添加这些注释。新论文可能需要数周,且并非所有论文都被标记。已开发机器学习模型以促进科学论文的语义索引。然而,它们在更全面的生物医学概念本体上的性能未达到NLP中研究的典型实体识别问题的水平。这在很大程度上归因于其低资源特性:本体规模庞大,缺乏描述大多数实体的文本,且标注数据仅能覆盖本体一小部分。本文中,我们开发了一种克服这些挑战的新模型,通过(1)泛化到训练时未见的实体,以及(2)将链接预测纳入提及分割决策。我们的方法在UMLS本体的传统识别/链接(+8 F1分)以及基于语义索引的评估(+10 F1分)上均取得了新的最先进结果。
引用
@article{arxiv.2101.10587,
title = {Low Resource Recognition and Linking of Biomedical Concepts from a Large Ontology},
author = {Sunil Mohan and Rico Angell and Nick Monath and Andrew McCallum},
journal= {arXiv preprint arXiv:2101.10587},
year = {2021}
}