基因组字典的帕累托最优压缩:兼顾或不兼顾主存中随机访问
数据结构与算法
2022-12-07 v1 基因组学
摘要
动机:基因组字典,即基因组中出现的 k-mer 集合,是基因组信息的基本来源:其收集是从组装到序列比对和系统发育等一系列策略性计算方法的第一步。遗憾的是,其存储代价高昂。这促使近期一些关于这些 k-mer 集合压缩的研究。然而,该领域尚未具备基因组压缩的成熟度,缺乏同质且方法严谨的实验基础,以公平比较现有方案的相对优劣,也未能考虑可使用的丰富压缩方法选择。结果:我们在此提供这样的基础,并以使用参考数据集和精心挑选的代表性数据压缩器的大量实验予以支撑。我们的结果凸显了在压缩与后处理的帕累托最优方面压缩器选择的光谱,后者在字典需多次解压时十分重要。除本研为有意以压缩形式存储 k-mer 字典的研究人员提供的、他处无法获得的实用指示外,还提供了一个可立即用于探索给定字典可用帕累托最优方案的软件系统。可用性:该软件系统可在 https://github.com/GenGrim76/Pareto-Optimal-GDC 获取,连同用户手册与安装说明。联系:[email protected] 补充信息:补充材料中提供额外数据。
引用
@article{arxiv.2212.03067,
title = {Pareto Optimal Compression of Genomic Dictionaries, with or without Random Access in Main Memory},
author = {Raffaele Giancarlo and Gennaro Grimaudo},
journal= {arXiv preprint arXiv:2212.03067},
year = {2022}
}
备注
Main: 13 pages, 3 tables, 3 figures; Supplementary Material: 17 pages, 20 tables, 10 figures