基于 HelixDock 在大规模生成对接构象上的预训练以释放蛋白质-配体结构预测模型的潜力
机器学习
2024-05-24 v4 计算工程、金融与科学
生物大分子
摘要
蛋白质-配体结构预测是药物发现中的一项关键任务,用于预测小分子(配体)与靶蛋白(受体)之间的结合相互作用。近期进展已引入深度学习技术以提升蛋白质-配体结构预测的精度。然而,对接构象的实验验证仍然昂贵,由于训练数据有限,这引发了人们对这些基于深度学习方法的泛化能力的担忧。本工作中,我们表明通过在传统基于物理的对接工具生成的大规模对接构象上进行预训练,随后使用有限的实验验证受体-配体复合物集合进行微调,可获得具有卓越性能的蛋白质-配体结构预测模型。具体而言,该过程涉及为蛋白质-配体配对生成1亿个对接构象,耗费约100万 CPU 核天。所提出的模型 HelixDock 旨在预训练阶段获取基于物理的对接工具所封装的物理知识。HelixDock 已与基于物理和基于深度学习的基线进行了严格基准测试,展示了其在预测结合构象时的 exceptional 精度与鲁棒可迁移性。此外,我们的研究揭示了预训练蛋白质-配体结构预测模型的缩放定律,表明随着模型参数与预训练数据量的增加,性能持续提升。我们还将 HelixDock 应用于若干药物发现相关任务以验证其实用价值。HelixDock 在交叉对接与基于结构的虚拟筛选基准上均展现出出色能力。
引用
@article{arxiv.2310.13913,
title = {Pre-Training on Large-Scale Generated Docking Conformations with HelixDock to Unlock the Potential of Protein-ligand Structure Prediction Models},
author = {Lihang Liu and Shanzhuo Zhang and Donglong He and Xianbin Ye and Jingbo Zhou and Xiaonan Zhang and Yaoyao Jiang and Weiming Diao and Hang Yin and Hua Chai and Fan Wang and Jingzhou He and Liang Zheng and Yonghui Li and Xiaomin Fang},
journal= {arXiv preprint arXiv:2310.13913},
year = {2024}
}