RNA 特征对 pre-miRNA 识别的判别能力
摘要
microRNA (miRNA) 的计算发现基于来自 miRNA 前体 (pre-miRNA) 的预定义特征集。当前用于 pre-miRNA 识别的工具所使用的这些特征集在构建和维度上各不相同。一些特征集由 pre-miRNA 中常见的序列 - 结构模式组成,而另一些则是更复杂的 RNA 特征的组合。尽管所使用的特征集及其计算成本差异很大,但当前工具实现了相似的预测性能。在本工作中,我们分析了六个 pre-miRNA 预测工具中使用的七个特征集的判别能力。该分析基于这些特征集在这些工具所用训练算法上实现的分类性能。我们还通过 F-score 和随机森林归纳中的特征重要性评估了特征判别力。与仅由序列 - 结构模式组成的特征集相比,更多样化的特征集产生的分类器具有显著更高的分类性能。然而,尽管维度存在巨大差异,但在使用具有特征多样化的集合诱导的分类器的估计分类性能之间,发现差异很小或不显著。基于这些结果,我们应用了一种特征选择方法来降低计算特征集的计算成本,同时保持判别能力。我们获得了一个低维特征集,其灵敏度达到 90%,特异度达到 95%。我们的特征集实现的灵敏度和特异度与任何特征集获得的最大值相差在 0.1% 以内,而其计算速度快了 34 倍。即使与文献中另一个计算成本最低且在最大值 0.1% 范围内表现的特征集相比,其计算速度也快 34 倍。
引用
@article{arxiv.1312.5778,
title = {The discriminant power of RNA features for pre-miRNA recognition},
author = {Ivani de O. N. Lopes and Alexander Schliep and André P. L. F. de Carvalho},
journal= {arXiv preprint arXiv:1312.5778},
year = {2014}
}
备注
Submitted to BMC Bioinformatics in October 25, 2013. The material to reproduce the main results from this paper can be downloaded from http://bioinformatics.rutgers.edu/Static/Software/discriminant.tar.gz