基于最优后缀多选择的部分数据压缩与文本索引
摘要
考虑从无限字母表中抽取的输入文本字符串 T[1,N]。我们研究数据压缩和文本索引中基于后缀问题的部分计算,例如:(I) 从 T 的 Burrows-Wheeler 变换中检索任意 K<=N 个连续符号的片段,以及 (II) 从后缀数组或后缀树中检索任意 K<=N 个连续条目。先前的文献通过解决构建 T 的完整 Burrows-Wheeler 变换或文本索引的总问题,并对结果进行后处理以提取所需部分,需要 O(N log N) 次比较(和时间)来解决这些问题。我们针对上述部分计算问题引入了一种新颖的自适应方法,并在 O(K log K + N) 次比较和时间内解决了这两个部分问题,从而将 K=o(N) 时的最佳已知运行时间从 O(N log N) 提升。这些部分计算问题密切相关,因为它们共享一个共同的瓶颈:后缀多选择问题,即按字典序输出排名为 r_1, r_2, ..., r_K 的后缀,其中 r_1 < r_2 < ... < r_K,且 r_i ∈ [1,N]。该问题的特例众所周知:K=N 是后缀排序问题,它是字符串学中的核心工作,拥有数百种应用;K=1 则是近期研究的后缀选择问题。我们证明后缀多选择问题可在 Theta(N log N - sum_{j=0}^K Delta_j log Delta_j + N) 时间和比较次数内解决,其中 r_0=0,r_{K+1}=N+1,且 Delta_j = r_{j+1} - r_j (0<=j<=K)。这在渐近意义上是最优的,并且与 [Dobkin, Munro, JACM 28(3)] 中针对原子元素(非后缀)的多选择问题的界限相匹配。使字符串问题的界限与原子元素的已知界限相匹配是 70 年代以来的长期主题和挑战,我们在此针对后缀多选择问题实现了这一目标。部分后缀问题以及后缀多选择问题具有许多应用。
引用
@article{arxiv.1110.3381,
title = {Partial Data Compression and Text Indexing via Optimal Suffix Multi-Selection},
author = {Gianni Franceschini and Roberto Grossi and S. Muthukrishnan},
journal= {arXiv preprint arXiv:1110.3381},
year = {2011}
}