中文

R-enum:在 BWT-runs 有界空间中枚举特征子串

数据结构与算法 2021-03-03 v4

摘要

枚举给定字符串中的特征子串(例如,最大重复子串、最小唯一子串和最小缺失词)一直是一个重要的研究课题,因为在字符串处理和计算生物学等各个领域有着广泛的应用。尽管已经提出了几种针对特征子串的枚举算法,但它们在空间上并不高效,因为其空间使用量与输入字符串的长度成正比。近年来,游程编码 Burrows-Wheeler 变换(RLBWT)在字符串处理中引起了越来越多的关注,并开发了各种基于 RLBWT 的算法。然而,开发基于 RLBWT 的特征子串枚举算法仍然是一个挑战。在本文中,我们提出了 r-enum(基于 RLBWT 的枚举),这是第一个基于 RLBWT 的特征子串枚举算法。对于字符串长度 nn 和 RLBWT 中的游程数 rr,R-enum 的运行时间为 O(nloglog(n/r))O(n \log \log (n/r)),工作空间为 O(rlogn)O(r \log n) 比特,其中对于高度重复的字符串(即具有许多重复的字符串),rr 预期显著小于 nn。在高度重复字符串的基准数据集上的实验表明,r-enum 的结果比以往的结果更具空间效率。此外,我们通过对 100 个人类基因组的 300 GB 字符串进行实验,展示了 r-enum 对超长字符串的适用性。

关键词

引用

@article{arxiv.2004.01493,
  title  = {R-enum: Enumeration of Characteristic Substrings in BWT-runs Bounded Space},
  author = {Takaaki Nishimoto and Yasuo Tabei},
  journal= {arXiv preprint arXiv:2004.01493},
  year   = {2021}
}

备注

The content of the paper is significantly different from the previous version