中文

PFP数据结构

数据结构与算法 2020-06-23 v1

摘要

前缀无关解析(PFP)由Boucher等人(2019)提出,作为简化基因组数据库Burrows-Wheeler变换(BWT)计算的预处理步骤。给定字符串SS,它生成重叠短语的字典DD与解析PP,使得BWT(S)\mathrm{BWT} (S)可由DDPP在以其组合大小PFP(S)|\mathrm{PFP} (S)|为界的运行时间与工作空间内计算出来。实践中DDPP显著小于SS,且由它们计算BWT(S)\mathrm{BWT} (S)比直接从SS计算更高效,至少当SS由同一物种个体的基因组构成时如此。本文将PFP(S)\mathrm{PFP} (S)视为一种{\em 数据结构},并展示如何对其进行扩充以在仍保持O(PFP(S))O (|\mathrm{PFP} (S)|)空间下快速支持以下查询:最长公共扩展(LCE)、后缀数组(SA)、最长公共前缀(LCP)与BWT。最后,我们提供实验证据表明,PFP数据结构可针对极大型重复数据集高效构建:对于最初约占56 GB的1000个人类19号染色体变异体,其构建耗时一小时、峰值内存54 GB。

关键词

引用

@article{arxiv.2006.11687,
  title  = {PFP Data Structures},
  author = {Christina Boucher and Ondřej Cvacho and Travis Gagie and Jan Holub and Giovanni Manzini and Gonzalo Navarro and Massimiliano Rossi},
  journal= {arXiv preprint arXiv:2006.11687},
  year   = {2020}
}