用于构建大型隧道式 Wheeler 图的前缀无关解析
数据结构与算法
2023-08-28 v1
摘要
我们提出一种为大型重复文本集合(例如包含同一物种多个个体序列的全基因组数据库)创建空间高效索引的新技术。我们结合了该领域的两种近期技术:Wheeler 图(Gagie 等人,2017)与前缀无关解析(PFP,Boucher 等人,2019)。Wheeler 图(WG)是一个通用框架,涵盖了若干基于 Burrows-Wheeler 变换(BWT)的索引,如 FM-index。Wheeler 图允许一种简洁表示,并可通过采用隧道化(tunnelling)思想进一步压缩,该思想利用称为块的平行且等标签路径形式的冗余,将其合并为单一路径。寻找用于隧道化的最优块集合(即最小化所得 WG 大小的集合)问题是 NP 完全的,并且仍是隧道化过程中计算最具挑战性的部分。为在更短时间内找到充分的块集合,我们提出一种基于前缀无关解析(PFP)的新方法。PFP 的思想是将输入文本划分为大小大致相等且以固定字符数重叠的短语。原始文本由短语秩序列(解析)与所有所用短语列表(字典)表示。在重复文本中,文本的 PFP 通常远短于原文。为加速隧道化的块选择,我们应用 PFP 获得文本的解析与字典,使用现有启发式方法对解析的 WG 进行隧道化,随后利用该隧道化解析构建原始文本的紧凑 WG。与不使用 PFP 从原始文本构建 WG 相比,我们的方法在全基因组序列集合上速度快得多且内存占用更少。因此,我们的方法使得 WG 能够作为真实世界数据集的全基因组参考。
引用
@article{arxiv.2206.15097,
title = {Prefix-free parsing for building large tunnelled Wheeler graphs},
author = {Adrián Goga and Andrej Baláž},
journal= {arXiv preprint arXiv:2206.15097},
year = {2023}
}
备注
12 pages, 3 figures, 2 tables, to be published in the WABI (Workshop on Algorithms in Bioinformatics) 2022 conference proceedings