基于上下文感知文献挖掘的 COVID-19 治疗靶点发现
计算与语言
2020-11-11 v2 数字图书馆
信息检索
摘要
与广泛传播的 COVID-19 大流行相关的文献数量之巨超出了单个专家的人工审阅能力。开发能够自动处理数万篇科学出版物、旨在通过基于文献的关联来丰富现有经验证据的系统既具挑战性又十分 relevant。我们提出了一种通过对实体间关系进行近似来对经验表达数据进行语境化的系统,这些实体的表示是从最大的 COVID-19 相关文献语料库之一中学习得到的。为了通过迁移学习利用更大的科学语境,我们提出了一种新颖的嵌入生成技术,该技术利用了在大型多领域科学出版物语料库上预训练并在 CORD-19 数据集上微调以进行领域自适应的 SciBERT 语言模型。由医学专家进行的手动评估以及基于相关工作中确定的治疗靶点的定量评估表明,所提出的方法可以成功用于 COVID-19 治疗靶点发现,并且大幅优于基线 FastText 方法。
引用
@article{arxiv.2007.15681,
title = {COVID-19 therapy target discovery with context-aware literature mining},
author = {Matej Martinc and Blaž Škrlj and Sergej Pirkmajer and Nada Lavrač and Bojan Cestnik and Martin Marzidovšek and Senja Pollak},
journal= {arXiv preprint arXiv:2007.15681},
year = {2020}
}
备注
Accepted to the 23rd International Conference on Discovery Science (DS 2020)