R-enum:在 BWT-runs 有界空间中枚举特征子串
数据结构与算法
2021-03-03 v4
摘要
枚举给定字符串中的特征子串(例如,最大重复子串、最小唯一子串和最小缺失词)一直是一个重要的研究课题,因为在字符串处理和计算生物学等各个领域有着广泛的应用。尽管已经提出了几种针对特征子串的枚举算法,但它们在空间上并不高效,因为其空间使用量与输入字符串的长度成正比。近年来,游程编码 Burrows-Wheeler 变换(RLBWT)在字符串处理中引起了越来越多的关注,并开发了各种基于 RLBWT 的算法。然而,开发基于 RLBWT 的特征子串枚举算法仍然是一个挑战。在本文中,我们提出了 r-enum(基于 RLBWT 的枚举),这是第一个基于 RLBWT 的特征子串枚举算法。对于字符串长度 和 RLBWT 中的游程数 ,R-enum 的运行时间为 ,工作空间为 比特,其中对于高度重复的字符串(即具有许多重复的字符串), 预期显著小于 。在高度重复字符串的基准数据集上的实验表明,r-enum 的结果比以往的结果更具空间效率。此外,我们通过对 100 个人类基因组的 300 GB 字符串进行实验,展示了 r-enum 对超长字符串的适用性。
引用
@article{arxiv.2004.01493,
title = {R-enum: Enumeration of Characteristic Substrings in BWT-runs Bounded Space},
author = {Takaaki Nishimoto and Yasuo Tabei},
journal= {arXiv preprint arXiv:2004.01493},
year = {2021}
}
备注
The content of the paper is significantly different from the previous version