BioRED:一个丰富的生物医学关系抽取数据集
计算与语言
2022-07-20 v2
摘要
从生物医学文献中自动抽取关系(RE)对研究与现实场景中的许多下游文本挖掘应用至关重要。然而,现有大多数生物医学 RE 基准数据集仅关注句子级单一类型关系(如蛋白质-蛋白质相互作用),极大限制了生物医学中 RE 系统的发展。本工作中,我们首先回顾常用命名实体识别(NER)与 RE 数据集。随后提出 BioRED,一种首创的具多实体类型(如基因/蛋白质、疾病、化学品)与关系对(如基因-疾病;化学-化学)的文档级生物医学 RE 语料,基于 600 篇 PubMed 摘要。进一步,我们将每关系标注为描述新发现或已知背景知识,使自动算法能区分新信息与背景信息。我们通过基准若干现有最先进方法(包括基于 BERT 的模型)于 NER 与 RE 任务来评估 BioRED 的效用。结果显示,虽现有方法在 NER 任务可达高性能(F 值 89.3%),RE 任务尤在抽取新关系上仍有很大改进空间(F 值 47.7%)。实验亦表明,此类丰富数据集可成功促进更准确、高效、鲁棒的生物医学 RE 系统发展。BioRED 数据集与标注指南可于 https://ftp.ncbi.nlm.nih.gov/pub/lu/BioRED/ 免费获取。
引用
@article{arxiv.2204.04263,
title = {BioRED: A Rich Biomedical Relation Extraction Dataset},
author = {Ling Luo and Po-Ting Lai and Chih-Hsuan Wei and Cecilia N Arighi and Zhiyong Lu},
journal= {arXiv preprint arXiv:2204.04263},
year = {2022}
}
备注
Accepted by Briefings in Bioinformatics