理解分子对接的主动学习及其应用
机器学习
2024-06-21 v1 化学物理
生物大分子
摘要
随着计算方法和资源能力的提升,通过分子对接进行超大规模虚拟筛选已成为计算机辅助命中发现的重要策略。鉴于超大规模虚拟筛选的穷举性质,主动学习方法通过迭代小规模对接和机器学习模型训练来降低计算成本,从而引起了关注。虽然现有文献已实证验证了主动学习方法的有效性,但对于代理模型如何在不考虑三维结构特征(如受体构象和结合姿态)的情况下预测对接分数,仍缺乏批判性研究。因此,在本文中,我们通过涵盖六个受体靶标的基准研究,探讨了主动学习方法如何仅使用二维结构有效预测对接分数,以及在何种情况下它们可能特别有效。我们的研究结果表明,代理模型倾向于记忆在获取步骤中获得的高对接分数化合物中普遍存在的结构模式。尽管存在这种倾向,代理模型在虚拟筛选中的实用性仍然得到证明,例如从DUD-E数据集中识别活性化合物,以及从比初始筛选库大得多的EnamineReal库中识别高对接分数化合物。我们的综合分析强调了主动学习方法在虚拟筛选活动中的可靠性和潜在适用性。
引用
@article{arxiv.2406.12919,
title = {Understanding active learning of molecular docking and its applications},
author = {Jeonghyeon Kim and Juno Nam and Seongok Ryu},
journal= {arXiv preprint arXiv:2406.12919},
year = {2024}
}