中文

基于双向字符串锚点的字符串采样

数据结构与算法 2021-12-21 v1

摘要

最小化子串采样机制是由 Schleimer 等人 [SIGMOD 2003] 和 Roberts 等人 [Bioinf. 2004] 分别独立提出的流行字符串采样机制。给定两个正整数 wwkk,它在每 ww 个连续的长度-kk 子串组成的片段(每个长度为 w+k1w + k - 1 的滑动窗口)中选择字典序最小的长度-kk 子串。最小化子串样本近似均匀、局部一致且可在线性时间内计算。最小化子串采样机制的两个主要缺点是:首先,对于任意 wwkk 的组合,其样本期望大小没有良好保证;其次,基于其样本构建的索引对于在线模式搜索没有良好的最坏情况保证。我们引入双向字符串锚点(bd-anchors),一种新的字符串采样机制。给定正整数 \ell,我们的机制在每个长度-\ell 片段(每个长度为 \ell 的滑动窗口)中选择字典序最小的循环移位。我们表明 bd-anchors 样本同样近似均匀、局部一致且可在线性时间内计算。此外,我们使用多个数据集的实验表明,bd-anchors 样本大小随 \ell 成比例减小;且这些大小在使用类似采样参数时与最小化子串样本大小相当或更小。我们通过分析 bd-anchors 样本期望大小为这些结果提供了理论依据。作为一个否定性结果,我们表明计算输入字母表上使 bd-anchors 样本大小最小的全序 \leq 是 NP-hard 的。我们还表明,通过使用任意 bd-anchors 样本,我们可以在近似线性时间内构建一个索引,该索引在样本大小上需要线性(额外)空间,并以近似最优时间回答在线模式搜索。

关键词

引用

@article{arxiv.2112.10376,
  title  = {String Sampling with Bidirectional String Anchors},
  author = {Grigorios Loukides and Solon P. Pissis and Michelle Sweering},
  journal= {arXiv preprint arXiv:2112.10376},
  year   = {2021}
}

备注

Extended version of an ESA 2021 paper; it includes proofs omitted from the conference version and new results obtained by Michelle Sweering