中文

通过错误负样本缓解与分解片段对比改进分子对比学习

机器学习 2022-06-01 v1 化学物理

摘要

深度学习在计算化学中已十分盛行,并被广泛用于分子性质预测。近来,自监督学习(SSL),尤其是对比学习(CL),因有望学习可泛化至巨大化学空间的分子表示而受到越来越多的关注。与监督学习不同,SSL 可直接利用大量无标签数据,大幅降低了通过昂贵耗时的模拟或实验获取分子性质标签的成本。然而,多数分子 SSL 方法借鉴了机器学习领域的思路,却忽视了分子特有的化学信息学特征(如分子指纹)和多级图结构(如官能团)。本文中,我们提出 iMolCLR:借助图神经网络(GNNs)从两方面改进分子表示对比学习,其一,通过考量分子对之间的化学信息学相似性来缓解错误负对比样本;其二,对从分子分解出的分子内与分子间子结构进行片段级对比。实验表明,所提策略显著提升了 GNN 模型在多项具有挑战性的分子性质预测任务上的性能。相较此前的 CL 框架,iMolCLR 在 7 个分类基准上 ROC-AUC 平均提升 1.3%,在 5 个回归基准上误差平均降低 4.8%。在多数基准上,经 iMolCLR 预训练的通用 GNN 可与甚至超越具备精巧架构设计与工程化特征的监督学习模型。进一步研究表明,iMolCLR 习得的表示内在嵌入了可推断分子相似性的骨架与官能团。

关键词

引用

@article{arxiv.2202.09346,
  title  = {Improving Molecular Contrastive Learning via Faulty Negative Mitigation and Decomposed Fragment Contrast},
  author = {Yuyang Wang and Rishikesh Magar and Chen Liang and Amir Barati Farimani},
  journal= {arXiv preprint arXiv:2202.09346},
  year   = {2022}
}

备注

30 pages, 4 figures, 4 tables. Manuscript in submission