ChemBoost:一种基于化学语言的蛋白-配体结合亲和力预测方法
机器学习
2020-12-22 v3 定量方法
机器学习
摘要
识别高亲和力的药物-靶点相互作用是药物发现中的核心研究问题。蛋白质通常以其结构或序列表示。然而,结构仅对一小部分生物分子可用,且序列相似性并不总是与功能相似性相关。我们提出 ChemBoost,一种基于化学语言、利用 SMILES 语法进行亲和力预测的方法。我们假设 SMILES 是一种编码语言,配体是由化学词组成的文档。这些文档可用于学习将相似语境中的词表示为相似向量的化学词向量。在 ChemBoost 中,配体通过化学词嵌入表示,而蛋白质通过基于序列的特征和/或其配体的化学词表示。我们的目标是将 SMILES 中的模式作为语言来处理以预测蛋白-配体亲和力,即便我们无法从序列推断功能。我们使用 eXtreme Gradient Boosting 在 KIBA 和 BindingDB 数据集中预测蛋白-配体亲和力。ChemBoost 预测药物-靶点结合亲和力的表现与最先进的机器学习系统相当或更好。当采用以配体为中心的表示时,ChemBoost 对蛋白质序列相似性的变化更鲁棒,并成功捕获蛋白质与配体间的相互作用,即使该蛋白质与配体的已知靶标序列相似性较低。
引用
@article{arxiv.1811.00761,
title = {ChemBoost: A chemical language based approach for protein-ligand binding affinity prediction},
author = {Rıza Özçelik and Hakime Öztürk and Arzucan Özgür and Elif Ozkirimli},
journal= {arXiv preprint arXiv:1811.00761},
year = {2020}
}
备注
Molecular Informatics