中文

使用卷积深度学习神经网络预测原核与真核启动子

基因组学 2016-10-04 v1

摘要

启动子的精确计算识别仍然是一个挑战,因为这些关键的 DNA 调控区域具有由功能基序组成的可变结构,这些基序提供了基因特异性的转录起始。在本文中,我们利用卷积神经网络(CNN)来分析原核和真核启动子的序列特征,并构建其预测模型。我们在四种相距甚远的生物:人类、植物(拟南芥)和两种细菌(大肠杆菌和肺炎支原体)的启动子上训练了相同的 CNN 架构。我们发现,在大肠杆菌启动子的 sigma70 亚类上训练的 CNN 对启动子与非启动子序列给出了极好的分类(Sn=0.90, Sp=0.96, CC=0.84)。枯草芽孢杆菌启动子识别 CNN 模型达到了 Sn=0.91, Sp=0.95, CC=0.86。对于人类和拟南芥启动子,我们采用 CNN 来识别两类众所周知的启动子类别(TATA 和非 TATA 启动子)。CNN 模型很好地识别了这些复杂的功能区域。对于人类,TATA 启动子的 Sn/Sp/CC 预测准确率分别达到了 0.95/0.98/0.90,非 TATA 启动子序列则为 0.90/0.98/0.89。对于拟南芥,我们观察到 TATA 启动子的 Sn/Sp/CC 为 0.95/0.97/0.91,非 TATA 启动子为 0.94/0.94/0.86。因此,所开发的 CNN 模型(在 CNNProm 程序中实现)展示了深度学习把握复杂启动子序列特征的能力,并与先前开发的启动子预测程序相比实现了显著更高的准确率。由于所提出的方法不需要任何特定启动子特征的知识,它可以很容易地扩展到识别许多其他生物,尤其是新测序基因组序列中的启动子和其他复杂功能区域。CNNProm 程序可在网络服务器 http://www.softberry.com 上运行。

关键词

引用

@article{arxiv.1610.00121,
  title  = {Prediction of Prokaryotic and Eukaryotic Promoters Using Convolutional Deep Learning Neural Networks},
  author = {Victor Solovyev and Ramzan Umarov},
  journal= {arXiv preprint arXiv:1610.00121},
  year   = {2016}
}

备注

12 pages, 4 figures