通过类比感知评估重新思考药物靶点亲和力预测算法的泛化能力
机器学习
2025-04-15 v1 统计方法学
摘要
药物靶点结合亲和力预测是药物发现中的基础任务。该问题在文献中已被广泛探索,取得了令人鼓舞的成果。然而,本文指出,这些结果可能具有误导性,难以在实际应用中得到良好泛化。核心观察是,常规评估中对测试集的随机划分方式导致测试集主要由与训练集高度相似的样本构成。模型在测试集上的性能在样本与训练集相似度较低时会显著下降,而这一缺陷在当前评估中被高度忽视。因此,当模型遇到与训练集相似度较低的样本时,其性能难以可靠。为解决此问题,本文提出了一种基于相似度感知的评估框架,其中提出了一种新颖的划分方法,以适应任何期望分布。这通过构建优化问题的表述形式实现,可通过梯度下降Approximately and efficiently求解。我们在四个数据集上对五种代表性方法进行了广泛实验,针对两种典型的靶点评估进行比较,并与各种对标方法进行了对比。结果表明,所提出的划分方法能够显著更好地适应期望分布,指导模型的开发。代码已发布于 https://github.com/Amshoreline/SAE/tree/main。
引用
@article{arxiv.2504.09481,
title = {Rethinking the generalization of drug target affinity prediction algorithms via similarity aware evaluation},
author = {Chenbin Zhang and Zhiqiang Hu and Chuchu Jiang and Wen Chen and Jie Xu and Shaoting Zhang},
journal= {arXiv preprint arXiv:2504.09481},
year = {2025}
}
备注
ICLR 2025 Oral