最短唯一子串最大数量的紧界
离散数学
2017-02-21 v2
摘要
如果字符串 S 的子串 Q 在 S 中恰好出现一次,该次出现包含区间 [s,t],且 S 中所有包含区间 [s,t] 且比 Q 短的子串在 S 中至少出现两次,则称 Q 为 S 中区间 [s,t] 的最短唯一子串(SUS)。SUS 问题是指,给定字符串 S,对其进行预处理,使得对于后续任意查询区间 [s,t],能够快速回答该区间 [s,t] 的所有 SUS。当 s = t 时,我们将 [s,t] 的 SUS 称为点 SUS;当 s \leq t 时,将其称为区间 SUS。现有最优的 O(n) 时间预处理方案能够以最优的 O(k) 时间回答点 SUS 和区间 SUS 的查询,其中 n 为 S 的长度,k 为给定查询的输出数量。本文揭示了 SUS 问题背后的结构与组合性质:即 S 中对应所有查询位置的点 SUS 的区间数量小于 1.5n,并证明这是一个匹配的上下界。此外,我们还考虑了 S 中对应所有查询区间的区间 SUS 的最大区间数量。
引用
@article{arxiv.1609.07220,
title = {Tight bounds on the maximum number of shortest unique substrings},
author = {Takuya Mieno and Shunsuke Inenaga and Hideo Bannai and Masayuki Takeda},
journal= {arXiv preprint arXiv:1609.07220},
year = {2017}
}