中文

基于运行长度压缩 BWT 的长匹配查询的高效数据结构与算法

计算与语言 2025-10-15 v2 机器学习

摘要

本文描述了一种新的匹配类型,这种匹配不一定在查询中是最大的,但仍包含有用的匹配信息:局部最大精确匹配 (LEMs)。由于 LEMs 通常数量庞大,因此我们仅考虑长度阈值 L\mathcal{L} 以上的 LEMs,这些被称为长 LEMs。长 LEMs 的目的是捕捉查询与文本之间不一定在模式中是最大的但仍足够长以被视为重要的子串匹配。因此,人们希望实现高效的长 LEMs 查找算法以处理这些数据集。然而,这些数据集太大,无法在传统字符串索引上进行查询。幸运的是,这些数据集非常重复。最近提出了一种利用数据中冗余性但保留高效查询能力的压缩字符串索引作为解决方案。因此,我们给出一种用于计算 BWT runs 压缩字符串索引中查询和文本之间所有长 LEMs 的高效算法。我们描述了一个以 O(r)O(r) 单词空间为基础的字符串索引,以期望 O(m+occ)O(m+occ) 的运行时间输出查询相对于文本的所有长 LEMs。这里的 mm 是查询长度,occocc 是输出的 LEMs 数量,rr 是 BWT 中运行的数量。我们描述的 O(r)O(r) 空间字符串索引依赖于对 Nishimoto 和 Tabei 的 move 数据结构的改造。我们能够在给定 SA[i]SA[i] 的情况下以恒定时间回答 LCP[i]LCP[i] 查询。换句话说,我们以恒定时间回答 PLCP[i]PLCP[i] 查询。长 LEMs 可能为查询与文本之间的相似性信息提供有用信息,这些信息可能被 MEMs 忽略。这种信息在 pangenome 和 biobank 规模的 haplotype panel 上下文中尤其有用。

关键词

引用

@article{arxiv.2505.15696,
  title  = {MaxPoolBERT: Enhancing BERT Classification via Layer- and Token-Wise Aggregation},
  author = {Maike Behrendt and Stefan Sylvius Wagner and Stefan Harmeling},
  journal= {arXiv preprint arXiv:2505.15696},
  year   = {2025}
}