中文

KMC 2:快速且资源节俭的$k$-mer计数

数据结构与算法 2017-03-03 v1 计算工程、金融与科学 基因组学

摘要

动机:构建核苷酸数据中每个长度为kk的符号子串出现次数的直方图是许多生物信息学应用的标准步骤,称为kk-mer计数。其应用包括开发de Bruijn图基因组组装器、快速多序列比对和重复检测。海量的NGS数据需要快速的kk-mer计数算法,最好使用适度的内存。结果:我们提出了一种新的kk-mer计数方法,在大型数据集上至少比最强的竞争对手(Jellyfish 2、KMC 1)快两倍,使用约12 GB(或更少)的RAM内存。我们的基于磁盘的方法与MSPKmerCounter有些相似,但用签名(所有最小化子的精心挑选子集)替换了原始的最小化子,并使用(k,x)(k, x)-mer,从而显著减少了I/O,高度并行的整体架构实现了前所未有的处理速度。例如,KMC 2可以在约20分钟内,在配备SSD的6核Intel i7 PC上,对44倍覆盖度的人类读段集合(压缩后106 GB)进行28-mer计数。可用性:KMC 2可在http://sun.aei.polsl.pl/kmc免费获取。联系方式:[email protected]

关键词

引用

@article{arxiv.1407.1507,
  title  = {KMC 2: Fast and resource-frugal $k$-mer counting},
  author = {Sebastian Deorowicz and Marek Kokot and Szymon Grabowski and Agnieszka Debudaj-Grabysz},
  journal= {arXiv preprint arXiv:1407.1507},
  year   = {2017}
}