中文

防泄漏 PDBBind:面向更具泛化性的结合亲和力预测的蛋白质-配体复合物重组数据集

生物物理 2026-01-13 v3

摘要

药物发现中用于预测蛋白质-配体结合构象与亲和力的多数机器学习评分函数均在 PDBBind 数据集上训练。然而,这些新评分函数是否真正优于传统模型尚不清楚,因为训练集与测试集常交叉污染有高相似度的蛋白质和配体,因而它们在无关蛋白质-配体复合物的结合预测中可能表现不佳。本工作中,我们精心准备了 PDBBind 数据集的新划分以控制数据泄漏(定义为具有高序列和结构相似度的蛋白质和配体)。所得防泄漏(LP)-PDBBind 数据用于重新训练四种流行评分函数:AutoDock Vina、随机森林(RF)-Score、InteractionGraphNet(IGN)和 DeepDTA,以更好地检验它们应用于新蛋白质-配体复合物时的能力。特别地,我们通过将 BindingDB 中的高质量结合自由能与自 2020 年以来 deposited 的 PDB 共结晶配体-蛋白质复合物相匹配,构建了新独立数据集 BDB2020+。基于所有基准测试结果,使用 LP-PDBBind 重训练的模型一致表现更优,其中尤其推荐 IGN 用于新蛋白质-配体系统的打分与排序应用。

关键词

引用

@article{arxiv.2308.09639,
  title  = {Leak Proof PDBBind: A Reorganized Dataset of Protein-Ligand Complexes for More Generalizable Binding Affinity Prediction},
  author = {Jie Li and Xingyi Guan and Oufan Zhang and Kunyang Sun and Yingze Wang and Dorian Bagni and Teresa Head-Gordon},
  journal= {arXiv preprint arXiv:2308.09639},
  year   = {2026}
}