借助高效从头组装实现的下一代测序读长压缩
定量方法
2012-07-11 v1 数据结构与算法
基因组学
摘要
我们提出了 Quip,一种用于 FASTQ 和 SAM/BAM 格式下一代测序数据的无损压缩算法。除了实现基于参考序列的压缩外,据我们所知,我们还使用一种新颖的 de novo assembly 算法开发了首个基于组装的压缩器。我们使用一种概率数据结构,大幅减少了传统 de Bruijn graph 组装器所需的内存,使得数百万读长能够非常高效地被组装。随后,读长序列被存储为它们在组装后的 contigs 中的位置。这与读长标识符、质量分数、比对信息和序列的统计压缩相结合,有效地将非常大的数据集压缩至不到其原始大小的15%,且无任何信息损失。可用性:Quip 可在 BSD 许可下从 http://cs.washington.edu/homes/dcjones/quip 免费获取。
引用
@article{arxiv.1207.2424,
title = {Compression of next-generation sequencing reads aided by highly efficient de novo assembly},
author = {Daniel C. Jones and Walter L. Ruzzo and Xinxia Peng and Michael G. Katze},
journal= {arXiv preprint arXiv:1207.2424},
year = {2012}
}