GDC 2:大型基因组集合的压缩
数据结构与算法
2017-03-03 v1 计算工程、金融与科学
基因组学
摘要
高通量基因组测序价格的下降改变了现代基因组学的格局。许多旨在测序多个人类基因组的大型项目正在进行中。基因组测序也成为个性化医疗的重要辅助手段。这一变化的显著副作用之一是必须存储和传输海量基因组数据。在本文中,我们处理大型完整基因组序列集合的压缩问题。我们提出一种能够将 1092 个人类二倍体基因组的集合压缩约 9,500 倍的算法。这一结果比现有其他压缩器所提供的结果好约 4 倍。此外,我们的算法非常快,在现代工作站上以 200MB/s 的速度处理数据。因此,所提出的算法允许以低成本存储完整的基因组集合,例如,所检查的 1092 个人类基因组的集合在压缩时仅需要约 700MB,而未压缩的 FASTA 文件约为 6.7 TB。源代码可在 http://sun.aei.polsl.pl/REFRESH/index.php?page=projects&project=gdc&subpage=about 获取。
引用
@article{arxiv.1503.01624,
title = {GDC 2: Compression of large collections of genomes},
author = {Sebastian Deorowicz and Agnieszka Danek and Marcin Niemiec},
journal= {arXiv preprint arXiv:1503.01624},
year = {2017}
}