用于从大量同源氨基酸序列直接耦合分析蛋白质结构的快速伪似然最大化
定量方法
2014-09-16 v1 计算物理
数据分析、统计与概率
摘要
直接耦合分析是一组方法,通过从数据中学习指数族生成模型,来获取蛋白质家族中协变残基的信息。在现实规模的蛋白质家族中,这种学习只能近似进行,并且在推断精度和计算速度之间存在权衡。我们在此表明,先前引入的称为 plmDCA 的 正则化伪似然最大化方法可以被修改,使其易于并行化,并且在单处理器上具有内在的更快的速度,而准确性的差异微乎其微。我们在蛋白质家族数据库(PFAM)的 148 个蛋白质家族上测试了该方法的新版本,这是迄今为止对该类算法规模最大的测试之一。
引用
@article{arxiv.1401.4832,
title = {Fast pseudolikelihood maximization for direct-coupling analysis of protein structure from many homologous amino-acid sequences},
author = {Magnus Ekeberg and Tuomo Hartonen and Erik Aurell},
journal= {arXiv preprint arXiv:1401.4832},
year = {2014}
}
备注
33 pages, 4 figures; M. Ekeberg and T. Hartonen are joint first authors; code and supplementary information on http://plmdca.csc.kth.se/