中文

由 AI 与 HPC 赋能的 SARS-CoV-2 先导化合物生成:从自然语言文本中提取类药物分子的模型与流程

计算与语言 2021-01-13 v1 信息检索 机器学习

摘要

全球研究人员正寻求重定位现有药物或发现新药物以对抗由严重急性呼吸综合征冠状病毒 2(SARS-CoV-2)引起的疾病。此类研究的一个有前景的候选来源是科学文献中报道的在冠状病毒研究背景下具有类药物特性的分子。我们在此报告一个项目,其利用人类与人工智能两者来检测自由文本中对类药物分子的提及。我们组织非专家人类创建标注文本语料库,使用该标注语料库训练命名实体识别模型,并采用训练后的模型从包含 198875 篇论文的 COVID-19 开放研究数据集挑战(CORD-19)语料库中提取出 10912 个类药物分子。性能分析表明,我们的自动化提取模型可达到与非专家人类相当的性能。

关键词

引用

@article{arxiv.2101.04617,
  title  = {AI- and HPC-enabled Lead Generation for SARS-CoV-2: Models and Processes to Extract Druglike Molecules Contained in Natural Language Text},
  author = {Zhi Hong and J. Gregory Pauloski and Logan Ward and Kyle Chard and Ben Blaiszik and Ian Foster},
  journal= {arXiv preprint arXiv:2101.04617},
  year   = {2021}
}

备注

17 single-column pages, 6 figures, and 6 tables