中文

从大规模无标签分子学习分子表示以用于药物发现

机器学习 2020-12-22 v1 生物大分子 定量方法

摘要

如何生成具有表达力的分子表示是 AI 驱动药物发现中的一项基本挑战。图神经网络(GNN)已成为建模分子数据的强大技术。然而,先前的监督方法通常受限于标签数据的稀缺且泛化能力较差。在此,我们提出了一种新颖的基于图的分子预训练深度学习框架,名为 MPG,其从大规模无标签分子学习分子表示。在 MPG 中,我们提出了一种强大的 MolGNet 模型以及一种在节点和图层级预训练模型的有效自监督策略。在 1100 万无标签分子上预训练后,我们发现 MolGNet 能够捕捉有价值的化学洞察以产生可解释的表示。预训练的 MolGNet 仅需添加一个额外的输出层进行微调,即可为广泛的 drug discovery 任务创建最先进的模型,包括分子性质预测、药物-药物互作和药物-靶标互作,涉及 13 个基准数据集。我们的工作表明 MPG 有望成为药物发现流程中的一种新方法。

关键词

引用

@article{arxiv.2012.11175,
  title  = {Learn molecular representations from large-scale unlabeled molecules for drug discovery},
  author = {Pengyong Li and Jun Wang and Yixuan Qiao and Hao Chen and Yihuan Yu and Xiaojun Yao and Peng Gao and Guotong Xie and Sen Song},
  journal= {arXiv preprint arXiv:2012.11175},
  year   = {2020}
}