中文

这些不是你寻找的k-mer:使用概率数据结构的高效在线k-mer计数

基因组学 2014-08-07 v4

摘要

K-mer丰度分析广泛用于核苷酸序列分析的许多目的,包括从头组装的预处理、重复检测和测序覆盖度估计。我们介绍了khmer软件包,用于快速且内存高效地在线计数测序数据集中的k-mer。与之前基于哈希表、后缀数组和trie结构等数据结构的方法不同,khmer完全依赖于一个简单的概率数据结构——Count-Min Sketch。Count-Min Sketch允许在线更新和检索内存中的k-mer计数,这对于支持在线k-mer分析算法是必要的。在稀疏数据集上,该数据结构比任何精确数据结构都更节省内存。作为交换,使用Count-Min Sketch引入了对k-mer的系统性过高计数;此外,只存储计数,而不存储k-mer。在这里,我们分析了khmer在生成k-mer频率分布和检索单个k-mer计数方面的速度、内存使用和错误计数率。我们还将khmer的性能与其他几个k-mer计数软件包进行了比较,包括Tallymer、Jellyfish、BFCounter、DSK、KMC、Turtle和KAnalyze。最后,我们检查了在高khmer假阳性率背景下,测序错误分析、k-mer丰度修剪和读段数字归一化的有效性。khmer用C++实现,封装在Python接口中,提供经过测试且稳健的API,并在BSD许可下免费提供于github.com/ged-lab/khmer。

关键词

引用

@article{arxiv.1309.2975,
  title  = {These are not the k-mers you are looking for: efficient online k-mer counting using a probabilistic data structure},
  author = {Qingpeng Zhang and Jason Pell and Rosangela Canino-Koning and Adina Chuang Howe and C. Titus Brown},
  journal= {arXiv preprint arXiv:1309.2975},
  year   = {2014}
}