利用机器学习高效预测 DNA 结合蛋白
计算机视觉与模式识别
2012-07-12 v1 定量方法
摘要
DNA 结合蛋白是一类对 DNA 具有特异性或一般亲和力的蛋白质,包括三个重要组成部分:转录因子、核酸酶和组蛋白。DNA 结合蛋白还在多种细胞活动中发挥重要作用。在本文中,我们描述了用于预测 DNA 结合蛋白的机器学习系统,其中优化并比较了支持向量机(Support Vector Machine)和级联相关神经网络(Cascade Correlation Neural Network),以确定实现最佳预测性能的学习算法。用于分类的信息源自包括总电荷、斑块大小和氨基酸组成在内的特征。总共使用了 121 种 DNA 结合蛋白和 238 种非结合蛋白来构建和评估该系统。对于使用 ANOVA 核并采用留一法(Jack-knife)评估的 SVM,其准确率达到 86.7%,灵敏度为 91.1%,特异度为 85.3%。对于在整个数据集上优化并采用留一法评估的 CCNN,我们报告的准确率为 75.4%,其特异度和灵敏度分别为 72.3% 和 82.6%。
引用
@article{arxiv.1207.2600,
title = {Efficient Prediction of DNA-Binding Proteins Using Machine Learning},
author = {Sokyna Qatawneh and Afaf Alneaimi and Thamer Rawashdeh and Mmohammad Muhairat and Rami Qahwaji and Stan Ipson},
journal= {arXiv preprint arXiv:1207.2600},
year = {2012}
}