KMC 2:快速且资源节俭的$k$-mer计数
数据结构与算法
2017-03-03 v1 计算工程、金融与科学
基因组学
摘要
动机:构建核苷酸数据中每个长度为的符号子串出现次数的直方图是许多生物信息学应用的标准步骤,称为-mer计数。其应用包括开发de Bruijn图基因组组装器、快速多序列比对和重复检测。海量的NGS数据需要快速的-mer计数算法,最好使用适度的内存。结果:我们提出了一种新的-mer计数方法,在大型数据集上至少比最强的竞争对手(Jellyfish 2、KMC 1)快两倍,使用约12 GB(或更少)的RAM内存。我们的基于磁盘的方法与MSPKmerCounter有些相似,但用签名(所有最小化子的精心挑选子集)替换了原始的最小化子,并使用-mer,从而显著减少了I/O,高度并行的整体架构实现了前所未有的处理速度。例如,KMC 2可以在约20分钟内,在配备SSD的6核Intel i7 PC上,对44倍覆盖度的人类读段集合(压缩后106 GB)进行28-mer计数。可用性:KMC 2可在http://sun.aei.polsl.pl/kmc免费获取。联系方式:[email protected]。
引用
@article{arxiv.1407.1507,
title = {KMC 2: Fast and resource-frugal $k$-mer counting},
author = {Sebastian Deorowicz and Marek Kokot and Szymon Grabowski and Agnieszka Debudaj-Grabysz},
journal= {arXiv preprint arXiv:1407.1507},
year = {2017}
}