DeepGS:用于药物-靶点结合亲和力预测的图与序列深度表示学习
机器学习
2020-04-06 v2 定量方法
摘要
在计算机中准确预测药物-靶点结合亲和力(DTA)是药物发现中的一项关键任务。大多数传统 DTA 预测方法基于模拟,严重依赖领域知识或拥有靶点 3D 结构的假设,而后者往往难以获取。同时,传统基于机器学习的方法应用各种特征与描述符,并简单地依赖于药物-靶点对之间的相似性。近来,随着可用亲和力数据量的增加以及深度表示学习模型在各领域的成功,深度学习技术已被应用于 DTA 预测。然而,这些方法要么考虑标签/独热编码,要么考虑分子的拓扑结构,而未考虑氨基酸与 SMILES 序列的局部化学语境。受此启发,我们提出了一种新颖的端到端学习框架,称为 DeepGS,其使用深度神经网络从氨基酸与 SMILES 序列中提取局部化学语境,以及从药物中提取分子结构。为辅助符号数据上的操作,我们提出使用先进嵌入技术(即 Smi2Vec 与 Prot2Vec)将氨基酸与 SMILES 序列编码为分布式表示。同时,我们提出了一种在我们的框架下表现良好的新分子结构建模方法。我们进行了大量实验,将所提方法与包括 KronRLS、SimBoost、DeepDTA 和 DeepCPI 在内的最先进模型进行比较。广泛的实验结果证明了 DeepGS 的优越性与竞争力。
引用
@article{arxiv.2003.13902,
title = {DeepGS: Deep Representation Learning of Graphs and Sequences for Drug-Target Binding Affinity Prediction},
author = {Xuan Lin},
journal= {arXiv preprint arXiv:2003.13902},
year = {2020}
}