中文

BioRED:一个丰富的生物医学关系抽取数据集

计算与语言 2022-07-20 v2

摘要

从生物医学文献中自动抽取关系(RE)对研究与现实场景中的许多下游文本挖掘应用至关重要。然而,现有大多数生物医学 RE 基准数据集仅关注句子级单一类型关系(如蛋白质-蛋白质相互作用),极大限制了生物医学中 RE 系统的发展。本工作中,我们首先回顾常用命名实体识别(NER)与 RE 数据集。随后提出 BioRED,一种首创的具多实体类型(如基因/蛋白质、疾病、化学品)与关系对(如基因-疾病;化学-化学)的文档级生物医学 RE 语料,基于 600 篇 PubMed 摘要。进一步,我们将每关系标注为描述新发现或已知背景知识,使自动算法能区分新信息与背景信息。我们通过基准若干现有最先进方法(包括基于 BERT 的模型)于 NER 与 RE 任务来评估 BioRED 的效用。结果显示,虽现有方法在 NER 任务可达高性能(F 值 89.3%),RE 任务尤在抽取新关系上仍有很大改进空间(F 值 47.7%)。实验亦表明,此类丰富数据集可成功促进更准确、高效、鲁棒的生物医学 RE 系统发展。BioRED 数据集与标注指南可于 https://ftp.ncbi.nlm.nih.gov/pub/lu/BioRED/ 免费获取。

关键词

引用

@article{arxiv.2204.04263,
  title  = {BioRED: A Rich Biomedical Relation Extraction Dataset},
  author = {Ling Luo and Po-Ting Lai and Chih-Hsuan Wei and Cecilia N Arighi and Zhiyong Lu},
  journal= {arXiv preprint arXiv:2204.04263},
  year   = {2022}
}

备注

Accepted by Briefings in Bioinformatics