蛋白质亚结构片段规范词典的统计推断
定量方法
2013-10-08 v1 生物大分子
摘要
蛋白质是生命的生物大分子,它们折叠成多种多样的三维 (3D) 形状。这些折叠模式的基础是许多重复出现的结构片段或构建模块(类似于'LEGO 积木')。本文报告了一种创新的统计推断方法,旨在从大量实验测定的蛋白质结构语料库中发现一个全面的蛋白质结构构建模块词典。我们的方法建立在贝叶斯和信息论的最小消息长度准则之上。据我们所知,这项工作是对结构生物信息学这一跨学科领域中出现的非常重要的数据挖掘问题的首次系统且严谨的处理。我们所发现词典的质量通过其解释力得到了证明——已知 3D 结构语料库中的任何蛋白质都可以被剖析为分配给该词典中片段的连续区域。这诱导出了三维蛋白质折叠模式的一种新颖的一维表示,适用于应用丰富的字符串处理算法库,从而快速识别新测定结构的折叠模式。本文介绍了用于推断构建模块词典的方法细节,并辅以说明性示例以展示其有效性和实用性。
引用
@article{arxiv.1310.1462,
title = {Statistical Inference of a canonical dictionary of protein substructural fragments},
author = {Arun S. Konagurthu and Arthur M. Lesk and David Abramson and Peter J. Stuckey and Lloyd Allison},
journal= {arXiv preprint arXiv:1310.1462},
year = {2013}
}
备注
17 pages, 3 Figures (Accepted for publication as a short paper in the 'The thirteenth International Conference on Data Mining (ICDM '13; Dallas, Texas Dec 7-10 2013)