中文

多序列比对深度对蛋白质协变 Potts 统计模型的影响

定量方法 2019-03-13 v2

摘要

Potts 统计模型已成为分析蛋白质多序列比对(MSA)中突变协变以理解蛋白质结构、功能和适应度的一种流行且有前景的方法。但这些模型的统计局限性尚未被充分理解,这些模型可具有数百万参数,并使用称为逆 Ising 推断的过程拟合到仅数千或数百条有效序列的 MSA 上。在这项工作中,我们预测在 Potts 模型的不同应用中,模型质量如何随序列数 NN、序列长度 LL、氨基酸字母表大小 qq 以及 MSA 的保守程度而退化:在单个蛋白质序列的“适应度”预测中,在单点突变效应预测中,在 epistasis 的“双突变循环”预测中,以及在蛋白质结构的三维接触预测中。我们展示了随着 MSA 深度 NN 减小如何发生“过拟合”效应,使得训练 MSA 中的序列具有被高估的适应度,我们预测了该效应的幅度并讨论正则化如何帮助纠正它,使用了受有限采样效应统计分析启发的正则化过程。我们发现随着 NN 减小,点突变效应预测的质量退化最少,适应度和 epistasis 预测退化更快,而接触预测受影响最大。然而,对于超过几千条有效序列的 MSA 深度(如实践中常用的),过拟合变得可忽略,正则化变得不那么必要。我们讨论了这些结果对 Potts 协变分析使用者的启示。

关键词

引用

@article{arxiv.1812.04162,
  title  = {Influence of Multiple Sequence Alignment Depth on Potts Statistical Models of Protein Covariation},
  author = {Allan Haldane and Ronald M. Levy},
  journal= {arXiv preprint arXiv:1812.04162},
  year   = {2019}
}