中文

GDC 2:大型基因组集合的压缩

数据结构与算法 2017-03-03 v1 计算工程、金融与科学 基因组学

摘要

高通量基因组测序价格的下降改变了现代基因组学的格局。许多旨在测序多个人类基因组的大型项目正在进行中。基因组测序也成为个性化医疗的重要辅助手段。这一变化的显著副作用之一是必须存储和传输海量基因组数据。在本文中,我们处理大型完整基因组序列集合的压缩问题。我们提出一种能够将 1092 个人类二倍体基因组的集合压缩约 9,500 倍的算法。这一结果比现有其他压缩器所提供的结果好约 4 倍。此外,我们的算法非常快,在现代工作站上以 200MB/s 的速度处理数据。因此,所提出的算法允许以低成本存储完整的基因组集合,例如,所检查的 1092 个人类基因组的集合在压缩时仅需要约 700MB,而未压缩的 FASTA 文件约为 6.7 TB。源代码可在 http://sun.aei.polsl.pl/REFRESH/index.php?page=projects&project=gdc&subpage=about 获取。

关键词

引用

@article{arxiv.1503.01624,
  title  = {GDC 2: Compression of large collections of genomes},
  author = {Sebastian Deorowicz and Agnieszka Danek and Marcin Niemiec},
  journal= {arXiv preprint arXiv:1503.01624},
  year   = {2017}
}