在文法压缩文本中计算全对全最大精确匹配
信息检索
2023-06-30 v1 数据结构与算法
摘要
我们描述了一种压缩感知方法,用于计算重复集合 中字符串之间的全对全最大精确匹配(MEM)。我们工作的关键概念是从 构造一个完全平衡的文法 ,并满足我们称之为\emph{无前缀冲突}(fix-free)的性质:在解析树中高度相同的非终结符的展开构成一个无前缀冲突集(即前缀无关且后缀无关)。该无前缀冲突性质使我们能够基于标准后缀树 MEM 算法在 上增量计算 的 MEM,算法每次在一部分文法规则上运行且不对非终结符解压。通过修改 Christiansen 等人 2020 年的局部一致文法,我们展示了如何以线性时间和空间从 构建 。我们还证明了我们的 MEM 算法在 上以 时间运行并使用 比特,其中 为文法大小, 为 中 MEM 的数量。在结论中,我们讨论了如何修改我们的思路以在压缩空间内实现近似模式匹配。
引用
@article{arxiv.2306.16815,
title = {Computing all-vs-all MEMs in grammar-compressed text},
author = {Diego Diaz-Dominguez and Leena Salmela},
journal= {arXiv preprint arXiv:2306.16815},
year = {2023}
}