中文

i6mA-CNN:一种基于卷积的计算方法用于识别水稻基因组中的DNA N6-甲基腺嘌呤位点

基因组学 2020-08-12 v2 机器学习

摘要

腺嘌呤核苷酸中的DNA N6-甲基化(6mA)是一种复制后修饰,并负责许多生物学功能。全基因组6mA位点检测的实验方法是一个昂贵且人工密集的过程。自动化且准确的计算方法可帮助在长基因组中识别6mA位点,节省大量时间和金钱。我们的研究开发了一种基于卷积神经网络(CNN)的工具i6mA-CNN,能够识别水稻基因组中的6mA位点。我们的模型协调多种类型的特征,如受PseAAC启发的定制特征向量、多种独热表示和二核苷酸理化性质。它在基准数据集上通过5折交叉验证取得了受试者工作特征曲线下面积0.98和总体准确率0.94。最后,除水稻外,我们在另外两个植物基因组6mA位点识别数据集上评估了我们的模型。结果表明,我们提出的工具能够将其在植物基因组上识别6mA位点的能力泛化,而无需考虑植物物种。本研究的Web工具可在:https://cutt.ly/Co6KuWG 找到。补充数据(基准数据集、独立测试数据集、比较用途数据集、训练模型、理化性质值、用于基序发现的注意力机制细节)可在 https://cutt.ly/PpDdeDH 获取。

关键词

引用

@article{arxiv.2007.10458,
  title  = {i6mA-CNN: a convolution based computational approach towards identification of DNA N6-methyladenine sites in rice genome},
  author = {Ruhul Amin and Chowdhury Rafeed Rahman and Md. Sadrul Islam Toaha and Swakkhar Shatabda},
  journal= {arXiv preprint arXiv:2007.10458},
  year   = {2020}
}