人类表型-基因关系的银标准语料库
计算与语言
2020-04-14 v2
摘要
人类表型-基因关系对于充分理解某些表型异常及其相关疾病的起源至关重要。生物医学文献是这些关系最全面的来源,然而我们需要关系抽取(Relation Extraction)工具来自动识别它们。大多数此类工具需要标注语料库,据我们所知,目前尚无标注有人类表型-基因关系的语料库可用。本文提出表型-基因关系(PGR)语料库,一个包含人类表型与基因标注及其关系的银标准语料库。该语料库由 1712 篇摘要、5676 个人类表型标注、13835 个基因标注和 4283 个关系组成。我们使用命名实体识别(Named-Entity Recognition)工具生成该语料库,其结果由八位标注者部分评估,获得 87.01% 的准确率。通过使用该语料库,我们利用两个最先进的深度学习工具获得了有前景的结果,即 78.05% 的准确率。PGR 语料库已向公众研究社区开放。
引用
@article{arxiv.1903.10728,
title = {A Silver Standard Corpus of Human Phenotype-Gene Relations},
author = {Diana Sousa and Andre Lamurias and Francisco M. Couto},
journal= {arXiv preprint arXiv:1903.10728},
year = {2020}
}
备注
NAACL 2019