基于结构域序列数据利用岭回归估计线性概率模型预测蛋白质 O-糖基化
定量方法
2019-07-09 v2
摘要
本文使用岭回归估计线性概率模型(LPM)预测人类蛋白质中 O-GlcNAc 糖基化的可能性。为此,本文分析了在 S 或 T 位点或其极近处发生的三种相似蛋白质翻译后修饰(PTM)的序列:N-糖基化、O-黏蛋白型(O-GalNAc)糖基化和磷酸化。所得结果包括:1)O-糖基化的共有复合基序在糖基化位点两侧均不含 W。2)磷酸化的共有基序同样如此。3)对于 LPM 估计,N-糖基化序列被发现是非 O-糖基化序列的良好近似。4)氨基酸沿序列的选择性定位区分了蛋白质的 PTM。5)部分 N-糖基化序列同时在 S 或 T 位点被磷酸化。6)N-糖基化序列的 ASA 值在随机意义上大于 O-GlcNAc 糖基化序列的 ASA 值。7)结构属性(beta 转角 II、II'、螺旋、beta 桥、beta 发夹和 phi 角)是 O-GlcNAc 糖基化的重要 LPM 预测因子。以序列和结构数据作为解释变量的 LPM 产生了 99% 的 Kolmogorov-Smirnov(KS)统计量值。8)仅使用序列数据时,KS 统计量降至 80%,凸显了结构信息的相关性,而结构信息在 O-糖基化序列上较为稀疏。以 50% 作为预测 O-GlcNAc 糖基化的截断概率,该 LPM 将 21% 的样本外 O-GlcNAc 糖基化序列错误预测为未被糖基化。该误预测率周围的 95% 置信区间为 16% 至 26%。
引用
@article{arxiv.1805.09884,
title = {Ridge Regression Estimated Linear Probability Model Predictions of O-glycosylation in Proteins with Structural and Sequence Data},
author = {Rajaram Gana and Sona Vasudevan},
journal= {arXiv preprint arXiv:1805.09884},
year = {2019}
}
备注
40 pages