SSM-DTA:打破药物-靶标亲和力预测中的数据稀缺壁垒
生物大分子
2023-10-18 v3 人工智能
机器学习
摘要
准确预测药物-靶标亲和力(DTA)在早期药物发现中至关重要,有助于识别能有效与特定靶标相互作用并调节其活性的药物。虽然湿实验仍是最可靠的方法,但其耗时且资源密集,导致数据可用性有限,给深度学习方法带来挑战。现有方法主要聚焦于基于可用DTA数据开发技术,未能充分解决数据稀缺问题。为克服这一挑战,我们提出SSM-DTA框架,其包含三种简单但高效的策略:(1)一种多任务训练方法,将DTA预测与基于药物-靶标配对数据的掩码语言建模(MLM)相结合。(2)一种半监督训练方法,利用大规模未配对分子与蛋白质来增强药物与靶标表示。该方法不同于以往仅在预训练中使用分子或蛋白质的方法。(3)集成轻量级交叉注意力模块以改善药物与靶标间的交互,进一步提升预测精度。通过在BindingDB、DAVIS和KIBA等基准数据集上的大量实验,我们证明了框架的优越性能。此外,我们对特定药物-靶标结合活性、虚拟筛选实验、药物特征可视化及实际应用进行了案例研究,均展示了本工作的显著潜力。总之,我们提出的SSM-DTA框架解决了DTA预测中的数据局限挑战并取得了有前景的结果,为更高效准确的药物发现流程铺平了道路。我们的代码可在 获取。
引用
@article{arxiv.2206.09818,
title = {SSM-DTA: Breaking the Barriers of Data Scarcity in Drug-Target Affinity Prediction},
author = {Qizhi Pei and Lijun Wu and Jinhua Zhu and Yingce Xia and Shufang Xie and Tao Qin and Haiguang Liu and Tie-Yan Liu and Rui Yan},
journal= {arXiv preprint arXiv:2206.09818},
year = {2023}
}
备注
Accepted by Briefings in Bioinformatics 2023