利用字符串净频率的新特性进行高效计算
数据结构与算法
2024-04-24 v2
摘要
了解海量文本中哪些字符串是显著的——即哪些字符串是常见的且与其他字符串不同——对于文本压缩和词元化等多种应用很有价值。频率本身对显著性没有帮助,因为最常见的字符串是最短的字符串。一个引人注目的替代方案是净频率,它具有正净频率的字符串长度为最大的特性。然而,净频率仍相对未被探索,且先前没有文献展示如何高效地计算它。我们首先引入净频率的一个特性,该特性简化了原始定义。借此,我们研究了 Fibonacci 字词中具有正净频率的字符串。然后,我们利用我们的特性并解决了与净频率相关的两个关键问题。第一,\textsc{single-nf},如何在大小为 的字母表上、长度为 的输入文本中,计算给定长度为 的字符串的净频率。第二,\textsc{all-nf},给定长度为 的输入文本,如何报告每个具有正净频率的字符串。我们的方法利用了后缀数组、Burrows-Wheeler 变换的组件以及彩色区间列举问题的解。我们表明,对于这两个问题,我们的数据结构构建成本为 :利用此结构,我们在 时间内解决 \textsc{single-nf},在 时间内解决 \textsc{all-nf}。实验表明,对于 \textsc{single-nf},我们的方法比合理的基线快约 100 倍。对于 \textsc{all-nf},我们的结果表明,即使预先知道具有正净频率的字符串集合,仅仅确认它们的净频率为正所花费的时间也比使用我们专门设计的方法要长。
引用
@article{arxiv.2404.12701,
title = {Exploiting New Properties of String Net Frequency for Efficient Computation},
author = {Peaker Guo and Patrick Eades and Anthony Wirth and Justin Zobel},
journal= {arXiv preprint arXiv:2404.12701},
year = {2024}
}
备注
Full version of a paper to be published at the 35th Annual Symposium on Combinatorial Pattern Matching (CPM 2024)