利用核岭回归学习肽 - 蛋白结合亲和力预测器
定量方法
2014-01-29 v1 机器学习
生物大分子
机器学习
摘要
我们提出了一种专为小生物分子、肽和结合界面伪序列设计的字符串核。该核结合了氨基酸的理化性质,并优雅地推广了八种核,如 Oligo、Weighted Degree、Blended Spectrum 和径向基函数(Radial Basis Function)。我们提供了一种低复杂度的动态规划算法用于核的精确计算,以及一种线性时间算法用于其近似。结合核岭回归和一种新的结合口袋核 SupCK,所提出的核在 PepX 数据库上产生了具有生物学意义且良好的预测精度。机器学习预测器首次能够准确预测任意肽与任意蛋白的结合亲和力。该方法还应用于单靶点和泛特异性主要组织相容性复合体 II 类(Major Histocompatibility Complex class II)基准数据集,以及三个定量结构亲和力模型(Quantitative Structure Affinity Model)基准数据集。在所有基准测试中,我们的方法在预测肽 - 蛋白结合亲和力方面显著(p-value < 0.057)优于当前最先进(state-of-the-art)的方法。所提出的方法具有灵活性,可用于预测任何定量生物活性。该方法对广大研究群体具有价值,有望加速基于肽的药物和疫苗开发。
引用
@article{arxiv.1207.7253,
title = {Learning a peptide-protein binding affinity predictor with kernel ridge regression},
author = {Sébastien Giguère and Mario Marchand and François Laviolette and Alexandre Drouin and Jacques Corbeil},
journal= {arXiv preprint arXiv:1207.7253},
year = {2014}
}
备注
22 pages, 4 figures, 5 tables