中文

在文法压缩文本中计算全对全最大精确匹配

信息检索 2023-06-30 v1 数据结构与算法

摘要

我们描述了一种压缩感知方法,用于计算重复集合 T\mathcal{T} 中字符串之间的全对全最大精确匹配(MEM)。我们工作的关键概念是从 T\mathcal{T} 构造一个完全平衡的文法 G\mathcal{G},并满足我们称之为\emph{无前缀冲突}(fix-free)的性质:在解析树中高度相同的非终结符的展开构成一个无前缀冲突集(即前缀无关且后缀无关)。该无前缀冲突性质使我们能够基于标准后缀树 MEM 算法在 G\mathcal{G} 上增量计算 T\mathcal{T} 的 MEM,算法每次在一部分文法规则上运行且不对非终结符解压。通过修改 Christiansen 等人 2020 年的局部一致文法,我们展示了如何以线性时间和空间从 T\mathcal{T} 构建 G\mathcal{G}。我们还证明了我们的 MEM 算法在 G\mathcal{G} 上以 O(G+occ)O(G +occ) 时间运行并使用 O(logG(G+occ))O(\log G(G+occ)) 比特,其中 GG 为文法大小,occoccT\mathcal{T} 中 MEM 的数量。在结论中,我们讨论了如何修改我们的思路以在压缩空间内实现近似模式匹配。

关键词

引用

@article{arxiv.2306.16815,
  title  = {Computing all-vs-all MEMs in grammar-compressed text},
  author = {Diego Diaz-Dominguez and Leena Salmela},
  journal= {arXiv preprint arXiv:2306.16815},
  year   = {2023}
}