基因组的描述性统计:病毒的系統发育分类
基因组学
2016-03-22 v2 定量方法
摘要
将新测序的病毒分类并提交至 NCBI 数据库的典型过程涉及两个步骤。首先,执行 BLAST 搜索以确定可能的科候选者。随后,使用成对序列比对工具检查候选科以寻找相似物种。然后由提交者判断确定最可能的物种分类。本文旨在表明,利用所提出的无比对方法和适当实施的机器学习技术,可以将此过程自动化为一个快速、准确的一步过程。我们提出了一族新的基因组无比对向量化方法,即广义向量 (generalized vector),它在保持现有无比对方法速度的同时,优于所有可用方法。这种新的无比对向量化方法借鉴了组成向量 (composition vector) 中使用基因组词 (k-mers) 频率的做法,并受自然向量 (natural vector) 启发,融入了这些 k-mers 位置信息的描述性统计量。我们利用 -最近邻分类分析了 5 种不同的基因组相似性表征,并在总计超过 10,000 个病毒的两个病毒集合上进行了评估。结果表明,在系统发育层级的每个层次上,我们提出的方法表现优于或等同于其他方法。数据和 R 代码可应要求提供。
引用
@article{arxiv.1309.0408,
title = {Descriptive Statistics of the Genome: Phylogenetic Classification of Viruses},
author = {Troy Hernandez and Jie Yang},
journal= {arXiv preprint arXiv:1309.0408},
year = {2016}
}
备注
14 pages, 4 tables, 1 figure