中文

基于接触图重叠的蛋白质结构分类研究

定量方法 2009-04-20 v1

摘要

已有多种度量方法被提出用于量化蛋白质三维结构之间的相似性。在这些度量中,接触图重叠(contact map overlap, CMO)最大化在过去十年中受到了持续关注,因为它能对蛋白质间的自然同源关系提供精细估计。尽管生物信息学和计算机科学界对此投入巨大,但已知算法的性能仍然有限。由于问题的复杂性,这些算法往往局限于相对较小的实例,无法适用于大规模比对。本文在此方面对过往方法做出了明确改进。我们提出了一种用于 CMO 的新整数规划模型,并设计了一种精确的分支定界(B&B)算法,其界限通过求解拉格朗日松弛得到。该方法在一个流行的小型基准测试集(Skolnick 集,40 个结构域)上展示了其效率。在该集合上,我们的算法显著优于现有的最佳精确算法,同时提供了质量更优的上下界。一些困难的 CMO 实例首次在规定时间内得以解决。根据运行时间和相对间隙(上下界之间的相对差异)的数值,我们对该测试集获得了正确的分类。这些令人鼓舞的结果促使我们设计了一个更具挑战性的基准测试,以更好地评估我们方法的分类能力。我们构建了一个包含 300 个蛋白质结构域的大型集合(ASTRAL 数据库的一个子集),并将其命名为 Proteus 300。利用任意 44850 对结构域之间的相对间隙作为相似性度量,我们获得的分类结果与 SCOP 高度一致。因此,我们的算法为大型结构数据库提供了一种强大的分类工具。

关键词

引用

@article{arxiv.0711.4208,
  title  = {Towards Structural Classification of Proteins based on Contact Map Overlap},
  author = {Rumen Andonov and Nicola Yanev and Noël Malod-Dognin},
  journal= {arXiv preprint arXiv:0711.4208},
  year   = {2009}
}