DecoyDB:面向蛋白-配体结合亲和力预测的图对比学习数据集
机器学习
2025-07-10 v1 生物大分子
摘要
预测蛋白-配体复合物的结合亲和力在药物发现中起着关键作用。然而,由于缺乏大规模高质量的结合亲和力标签,进展受到阻碍。已使用的 PDBbind 数据集包含的标记复合物不足 2 万个。自监督学习,特别是图对比学习(GCL),通过基于广量未标记复合物预训练图神经网络模型并在较少的标记复合物上微调模型,提供了突破性机会。然而,该方法面临独特挑战,包括缺乏包含明确正/负复合物对的全面未标记数据集,以及需要设计融合此类数据特征的 GCL算法。为填补这一空白,我们提出 DecoyDB,一个大规模、结构感知的数据集,专为蛋白-配体复合物的自监督 GCL 设计。DecoyDB 由高分辨率基准复合物(小于 2.5 埃)和多样化的 decoy 结构组成,这些 decoy 结构具有计算生成的结合构象,ranging 从真实到次优(作为负样本对)。每个 decoy 都标注了其与本源构象的根均方偏差(RMSD)。我们进一步设计了针对 DecoyDB 的定制 GCL 框架,用于预训练图神经网络,并使用 PDBbind 的标签进行微调。大量实验表明,使用 DecoyDB 预训练的模型在准确率、标签效率和泛化性方面均表现出优越性能。
引用
@article{arxiv.2507.06366,
title = {DecoyDB: A Dataset for Graph Contrastive Learning in Protein-Ligand Binding Affinity Prediction},
author = {Yupu Zhang and Zelin Xu and Tingsong Xiao and Gustavo Seabra and Yanjun Li and Chenglong Li and Zhe Jiang},
journal= {arXiv preprint arXiv:2507.06366},
year = {2025}
}