中文

面向精准蛋白-配体亲和力预测基准:完整且考虑修饰的 DAVIS 数据集

机器学习 2025-12-02 v1 生物大分子

摘要

AI 在科学领域的发展为关键药物发现任务如蛋白-配体结合亲和力预测开辟了可能性。然而,当前模型容易过拟合到那些不代表自然发生且生物学上相关蛋白质(尤其是带修饰的蛋白质)的过于简化数据集。本文通过纳入涉及取代、插入、删除和磷酸化事件的 4,032 对激酶-配体配对,构建了该广泛使用的 DAVIS 数据集的完整且考虑修饰版本。这个充实后的数据集可用于基于生物学上现实条件的模型评估。基于此新数据集,我们提出了三种基准设置——增强数据集预测、野生型到修饰的泛化以及少样本修饰泛化——以评估模型在蛋白质修饰存在下的鲁棒性。通过对 docking-free 和 docking 方法进行大量评估,我们发现 docking 方法在零样本情境下泛化性更好。相比之下,docking-free 模型容易过拟合野生型蛋白质,难以处理未见的修饰,但在在小规模修饰示例上微调后可显著提升。我们预期,精心策划的数据集和基准为开发能更好地泛化到蛋白质修饰的模型提供了宝贵基础,从而推动药物发现中的精准医疗。该基准数据集可在 https://github.com/ZhiGroup/DAVIS-complete 访问。

关键词

引用

@article{arxiv.2512.00708,
  title  = {Towards Precision Protein-Ligand Affinity Prediction Benchmark: A Complete and Modification-Aware DAVIS Dataset},
  author = {Ming-Hsiu Wu and Ziqian Xie and Shuiwang Ji and Degui Zhi},
  journal= {arXiv preprint arXiv:2512.00708},
  year   = {2025}
}