基于生物医学命名实体识别、面向 COVID-19 开放研究数据集挑战的语义增强数据集
数字图书馆
2020-05-19 v1
摘要
当前,COVID-19 相关研究是一项巨大且高度相关的挑战。需要新工具以相关且有价值的信息协助医学专家开展研究。COVID-19 开放研究数据集挑战(CORD-19)是面向计算机科学家开发这些创新工具的“行动号召”。许多此类应用由实体信息赋能,即知晓句子中使用了哪些实体。在本文中,我们基于最新的化学物质、疾病、基因与物种命名实体识别(NER)工具开发了一条处理流水线。我们将该流水线应用于 COVID-19 研究挑战,并与社区共享所得的实体提及。
引用
@article{arxiv.2005.08823,
title = {A Semantically Enriched Dataset based on Biomedical NER for the COVID19 Open Research Dataset Challenge},
author = {Hermann Kroll and Jan Pirklbauer and Johannes Ruthmann and Wolf-Tilo Balke},
journal= {arXiv preprint arXiv:2005.08823},
year = {2020}
}