DebiasedDTA:一种提升药物-靶标亲和力预测模型泛化能力的框架
定量方法
2023-01-10 v5 机器学习
摘要
能够准确预测输入蛋白质-化合物对结合亲和力的计算模型可加速药物发现研究。这些模型在可用的蛋白质-化合物相互作用数据集上训练,而数据集可能包含数据偏置,导致模型学习到数据集特定的模式,而非可泛化的关系。结果,模型对先前未见过的生物分子预测性能下降,即预测模型无法泛化到数据集之外的生物分子。旨在提升模型泛化能力的最新方法要么适用性有限,要么引入降低预测性能的风险。在此,我们提出DebiasedDTA,一种新颖的药物-靶标亲和力(DTA)预测模型训练框架,其解决数据偏置问题以提升亲和力预测模型的泛化能力。DebiasedDTA对训练样本重新加权以减轻数据偏置的影响,且适用于大多数DTA预测模型。结果表明,在DebiasedDTA框架下训练的模型在对先前未见生物分子相互作用的预测中可实现改进的泛化能力,同时对已见样本也有性能提升。采用不同生物分子表示、模型架构和数据集的广泛实验表明,无论生物分子表示、模型架构和训练数据集如何,DebiasedDTA都能升级DTA预测模型。最后但同样重要的是,我们将DebiasedDTA发布为一个开源python库,以使其他研究者能够对其自身的预测器去偏和/或开发自己的去偏方法。我们相信该python库将证实并促进开发更具泛化能力的DTA预测模型的研究。
引用
@article{arxiv.2107.05556,
title = {DebiasedDTA: A Framework for Improving the Generalizability of Drug-Target Affinity Prediction Models},
author = {Rıza Özçelik and Alperen Bağ and Berk Atıl and Melih Barsbey and Arzucan Özgür and Elif Özkırımlı},
journal= {arXiv preprint arXiv:2107.05556},
year = {2023}
}