面向生物医学文本中命名实体消歧的跨域数据集成
计算与语言
2021-10-18 v1 人工智能
摘要
命名实体消歧(NED)涉及将文本提及映射到结构化实体,在医学领域由于罕见实体的存在而尤其具有挑战性。现有方法受限于生物医学知识库中粗粒度结构资源的存在,以及所提供的训练数据集对不常见资源的低覆盖率。在本工作中,我们通过提出一种跨域数据集成方法来解决这些问题,该方法将来自通用文本知识库的结构知识迁移到医学领域。我们利用集成方案增强结构资源,并生成一个大型生物医学 NED 数据集用于预训练。我们注入了结构知识的预训练模型在两个基准医学 NED 数据集 MedMentions 和 BC5CDR 上取得了最优(state-of-the-art)性能。此外,我们将罕见实体的消歧准确率提升了多达 57 个百分点。
引用
@article{arxiv.2110.08228,
title = {Cross-Domain Data Integration for Named Entity Disambiguation in Biomedical Text},
author = {Maya Varma and Laurel Orr and Sen Wu and Megan Leszczynski and Xiao Ling and Christopher Ré},
journal= {arXiv preprint arXiv:2110.08228},
year = {2021}
}
备注
Accepted to Findings of EMNLP 2021