中文

面向生物医学文本中命名实体消歧的跨域数据集成

计算与语言 2021-10-18 v1 人工智能

摘要

命名实体消歧(NED)涉及将文本提及映射到结构化实体,在医学领域由于罕见实体的存在而尤其具有挑战性。现有方法受限于生物医学知识库中粗粒度结构资源的存在,以及所提供的训练数据集对不常见资源的低覆盖率。在本工作中,我们通过提出一种跨域数据集成方法来解决这些问题,该方法将来自通用文本知识库的结构知识迁移到医学领域。我们利用集成方案增强结构资源,并生成一个大型生物医学 NED 数据集用于预训练。我们注入了结构知识的预训练模型在两个基准医学 NED 数据集 MedMentions 和 BC5CDR 上取得了最优(state-of-the-art)性能。此外,我们将罕见实体的消歧准确率提升了多达 57 个百分点。

关键词

引用

@article{arxiv.2110.08228,
  title  = {Cross-Domain Data Integration for Named Entity Disambiguation in Biomedical Text},
  author = {Maya Varma and Laurel Orr and Sen Wu and Megan Leszczynski and Xiao Ling and Christopher Ré},
  journal= {arXiv preprint arXiv:2110.08228},
  year   = {2021}
}

备注

Accepted to Findings of EMNLP 2021