中文

大规模预训练提升基于主动学习的分子虚拟筛选的样本效率

机器学习 2023-09-22 v1 生物大分子

摘要

对大型化合物库进行虚拟筛选以识别潜在的命中候选物是药物发现最早的步骤之一。随着商业可用化合物集合的规模呈指数级增长至数十亿级别,使用对接(docking)等传统工具进行暴力虚拟筛选在时间和计算资源上变得不可行。主动学习和贝叶斯优化近来已被证明是缩小搜索空间的有效方法。这些方法中的一个关键组成部分是代理机器学习模型,该模型使用库的一小部分子集进行训练,以预测化合物的期望性质。准确的模型仅通过对整个库的一小部分进行虚拟筛选即可找到最有前景的化合物,从而实现高样本效率。在本研究中,我们考察了预训练的基于 transformer 的语言模型和图神经网络在贝叶斯优化主动学习框架中的性能。最佳的预训练模型在仅筛选包含 9950 万化合物的超大型库中 0.6% 的化合物后,按对接分数识别出了前 50000 名中的 58.97%,比先前最先进的基线提升了 8%。通过大量基准测试,我们表明预训练模型的优越性能在基于结构和基于配体的药物发现中均持续存在。此类模型可提升基于主动学习的分子虚拟筛选的准确性和样本效率。

关键词

引用

@article{arxiv.2309.11687,
  title  = {Large-scale Pretraining Improves Sample Efficiency of Active Learning based Molecule Virtual Screening},
  author = {Zhonglin Cao and Simone Sciabola and Ye Wang},
  journal= {arXiv preprint arXiv:2309.11687},
  year   = {2023}
}