中文

BioConceptVec:大规模创建与评估基于文献的生物医学概念嵌入

计算与语言 2020-07-01 v1 信息检索 机器学习

摘要

捕捉相关生物学概念(如基因与突变)的语义,对计算生物学中的许多研究任务(如蛋白质-蛋白质相互作用检测、基因-药物关联预测以及基于生物医学文献的发现)具有重要意义。在此,我们提议利用最先进的文本挖掘工具与机器学习模型,通过向量表示(即嵌入)来学习整个 PubMed 摘要中提及的超过 400,000 个生物学概念的语义。我们学习到的嵌入,即 BioConceptVec,能够基于文献中的上下文信息捕捉相关概念,这超越了精确术语匹配或基于共现的方法。BioConceptVec 已在多个生物信息学任务中经过充分评估,这些任务包含来自九个不同生物学数据集的超过 2500 万条实例。评估结果表明,BioConceptVec 在所有任务中的表现均优于现有方法。最后,BioConceptVec 已通过 https://github.com/ncbi-nlp/BioConceptVec 免费提供给研究界与公众使用。

关键词

引用

@article{arxiv.1912.10846,
  title  = {BioConceptVec: creating and evaluating literature-based biomedical concept embeddings on a large scale},
  author = {Qingyu Chen and Kyubum Lee and Shankai Yan and Sun Kim and Chih-Hsuan Wei and Zhiyong Lu},
  journal= {arXiv preprint arXiv:1912.10846},
  year   = {2020}
}

备注

33 pages, 6 figures, 7 tables, accepted by PLOS Computational Biology