PFP数据结构
数据结构与算法
2020-06-23 v1
摘要
前缀无关解析(PFP)由Boucher等人(2019)提出,作为简化基因组数据库Burrows-Wheeler变换(BWT)计算的预处理步骤。给定字符串,它生成重叠短语的字典与解析,使得可由和在以其组合大小为界的运行时间与工作空间内计算出来。实践中和显著小于,且由它们计算比直接从计算更高效,至少当由同一物种个体的基因组构成时如此。本文将视为一种{\em 数据结构},并展示如何对其进行扩充以在仍保持空间下快速支持以下查询:最长公共扩展(LCE)、后缀数组(SA)、最长公共前缀(LCP)与BWT。最后,我们提供实验证据表明,PFP数据结构可针对极大型重复数据集高效构建:对于最初约占56 GB的1000个人类19号染色体变异体,其构建耗时一小时、峰值内存54 GB。
引用
@article{arxiv.2006.11687,
title = {PFP Data Structures},
author = {Christina Boucher and Ondřej Cvacho and Travis Gagie and Jan Holub and Giovanni Manzini and Gonzalo Navarro and Massimiliano Rossi},
journal= {arXiv preprint arXiv:2006.11687},
year = {2020}
}