HMACA:提出一种基于元胞自动机的蛋白质编码、启动子区域识别与蛋白质结构预测工具
计算工程、金融与科学
2014-01-22 v1 机器学习
摘要
人体由大量细胞组成,每个细胞都含有脱氧核糖核酸(DNA)。从DNA序列中识别基因是一项非常困难的任务。相比之下,识别编码区域比前者更为复杂。识别在基因中占据微小位置的蛋白质是一个极具挑战性的问题。为了理解基因,编码区域分析发挥着重要作用。蛋白质是具有宏观结构的分子,负责广泛的至关重要的生化功能,包括输送氧气、细胞信号传导、抗体产生、营养运输和构建肌肉纤维。近年来,启动子区域识别和蛋白质结构预测受到了广泛关注。尽管已有一些解决该问题的识别技术,但识别启动子区域的近似准确率仅约为68%至72%。我们开发了一种基于元胞自动机的工具,该工具采用混合多吸引子元胞自动机(HMACA)分类器,用于蛋白质编码区域、启动子区域识别和蛋白质结构预测,其预测蛋白质和启动子区域的准确率达到76%。该工具预测蛋白质结构的准确率亦达到80%。
引用
@article{arxiv.1401.5364,
title = {HMACA: Towards Proposing a Cellular Automata Based Tool for Protein Coding, Promoter Region Identification and Protein Structure Prediction},
author = {Pokkuluri Kiran Sree and Inampudi Ramesh Babu and SSSN Usha Devi N},
journal= {arXiv preprint arXiv:1401.5364},
year = {2014}
}