基准测试中单姿态对接、共识重排序和监督机器学习方法:对 DiffDock、AutoDock-GPU、GNINA 和 DiffDock-NMDN 的关键评估
机器学习
2026-05-06 v2 生物大分子
摘要
虚拟筛选的性能高度依赖所选的对接和评分方法。近期基于人工智能的工具,如 DiffDock 和 NMDN,已报告出色的基准结果,但其在现实中、实验数据驱动的数据集上的实际实用性尚不明确。本文在 LIT-PCBA 图书馆(包含 15 个靶点、578,295 个配体-靶点对,均包含实验确认的活性和失活配体)上进行大规模评估。我们比较 AutoDock-GPU 和 DiffDock 用于构象生成,随后使用 GNINA 和 NMDN 进行重排序。我们进一步评估基于排名的共识策略以及在对接特征上训练的监督机器学习模型。GNINA 对 AutoDock-GPU 构象的重排序(AutoDock-GNINA)表现为最佳单一方法,中性 EF1% 为 2.14。DiffDock 基于的方法相对于 AutoDock-GNINA 表现不佳,尤其是在诱导性靶点如 OPRK1 上。精心设计的共识排序提高了鲁棒性,但未超过最佳单一评分器。监督 ML 重新排序取得最大提升,实现中性 EF1% 为 4.49(相较 AutoDock-GNINA 提升 110%)。我们的结果表明,即便是最佳的经典+机器学习混合工作流程在现实基准测试中也仅提供有限的早期富集。我们得出结论:没有单一对接方法在所有靶点上均占优势,严格验证、成本效益高的组合方案配合监督重新排序目前为虚拟筛选提供了最实用的价值。
引用
@article{arxiv.2605.01681,
title = {Benchmarking Single-Pose Docking, Consensus Rescoring, and Supervised ML on the LIT-PCBA Library: A Critical Evaluation of DiffDock, AutoDock-GPU, GNINA, and DiffDock-NMDN},
author = {Youssef Abo-Dahab and Xiaoiang Xiang and Joanne Chun and Liang Zhao},
journal= {arXiv preprint arXiv:2605.01681},
year = {2026}
}