中文

AIS-INMACA:一种基于 MACA 的新型集成克隆分类器用于蛋白质编码区与启动子区预测

计算工程、金融与科学 2014-03-25 v1 机器学习

摘要

生物信息学中的大多数问题现已成为计算挑战。本文旨在构建一种基于多吸引子细胞自动机(MACA)并采用模糊逻辑的分类器。该分类器结合了人工免疫系统技术(AIS)和克隆算法,用于识别给定 DNA 序列中的蛋白质编码区和启动子区。所提出的分类器命名为 AIS-INMACA,引入了一种将细胞自动机与人工免疫系统相结合的新概念,以生成能够解决生物信息学主要问题的更优分类器。这将是首个能够同时预测启动子和蛋白质编码区的集成算法。为获得良好的适应度规则,使用了克隆选择算法的基本概念。该分类器可处理长度为 54、108、162、252、354 的 DNA 序列。该分类器能以 89.6% 的平均准确率给出蛋白质区和启动子区的精确边界。该分类器使用了来自 Fickett & Toung、MPromDb 以及某知名医科大学的其他序列共 97,000 个数据组件进行了测试。该分类器能够处理海量数据集,甚至能在混合和重叠的 DNA 序列中找到蛋白质区和启动子区。这项工作还旨在识别生物信息学主要问题之间的逻辑关系,并试图获得一个通用框架,以解决蛋白质结构预测、RNA 结构预测、任意初级转录本剪接模式预测以及 DNA、RNA、蛋白质序列和信息内容分析等生物信息学主要问题。这项工作将吸引更多研究人员将细胞自动机作为一种潜在的模式分类器应用于生物信息学的许多重要问题。

关键词

引用

@article{arxiv.1403.5933,
  title  = {AIS-INMACA: A Novel Integrated MACA Based Clonal Classifier for Protein Coding and Promoter Region Prediction},
  author = {Pokkuluri Kiran Sree and Inampudi Ramesh Babu},
  journal= {arXiv preprint arXiv:1403.5933},
  year   = {2014}
}

备注

7 Pages