中文

蛋白质同源网络的全局统计分析

定量方法 2007-05-23 v1 分子网络

摘要

蛋白质序列间的相似度是一个可直接且容易计算的量,由此可推导其进化距离信息并检测同源蛋白。SIMAP数据库——蛋白质相似度矩阵——提供了一个预计算的相似度矩阵,覆盖由公共数据库和已完成测序基因组中几乎所有公开可用的氨基酸序列构成的相似度空间。基于SIMAP我们构建蛋白质同源网络,其中蛋白质为节点,连线表示同源关系。该网络拥有超过500万节点和约70×10^9条边,是有史以来构建的最大蛋白质同源网络。我们描述了其基本特征并进行了网络的全局统计分析。从Smith-Waterman相似度得分出发,我们为每条边定义一个权重w以度量两节点间的相似度距离。仅保留权重大于最小权重w_min的边,并通过改变w_min构建一系列具有不同相似度程度的网络。我们研究了不同w_min下网络连通分支(簇)的分布,特别地发现类似于由巨分支形成引导的相变行为。此外我们研究了在不同相似度层级连接网络中不同簇的蛋白质对的选定序列特征与蛋白质结构域。我们观察到在特定权重区间连接簇的蛋白质其特征与结构域具有特定的非随机分布。

关键词

引用

@article{arxiv.q-bio/0703053,
  title  = {Global statistical analysis of the protein homology network},
  author = {Concetta Miccio and Thomas Rattei},
  journal= {arXiv preprint arXiv:q-bio/0703053},
  year   = {2007}
}

备注

15 pages, 15 figures