中文

基于知识增强多通道 CNN 的基因组变异出版物文献分拣

计算与语言 2020-05-11 v1

摘要

背景:为了研究基因组变异与某些疾病或表型之间的相关性,基本任务是从海量文献中筛选出相关出版物,这被称为文献分拣。一些知识库,包括 UniProtKB/Swiss-Prot 和 NHGRI-EBI GWAS Catalog,被创建用于收集相关出版物。这些出版物由专家人工审编,这非常耗时。此外,由于出版物数量的快速增长,从文献中人工审编信息的方式不可扩展。为了降低文献分拣的成本,采用了机器学习模型来自动识别生物医学出版物。方法:与以往利用机器学习模型进行文献分拣的研究相比,我们采用多通道卷积网络来利用丰富的文本信息,同时弥合不同语料库之间的语义鸿沟。此外,在分拣过程中,还使用了从 UMLS 学习到的知识嵌入,以提供文本特征之外的额外医学知识。结果:我们证明,在知识嵌入和多通道的帮助下,我们的模型在 5 个数据集上优于现有先进模型。我们的模型提高了生物医学文献分拣结果的准确性。结论:多通道和知识嵌入增强了 CNN 模型在生物医学文献分拣任务中的性能。关键词:文献分拣;知识嵌入;多通道卷积网络

关键词

引用

@article{arxiv.2005.04044,
  title  = {Literature Triage on Genomic Variation Publications by Knowledge-enhanced Multi-channel CNN},
  author = {Chenhui Lv and Qian Lu and Xiang Zhang},
  journal= {arXiv preprint arXiv:2005.04044},
  year   = {2020}
}