中文

匹配统计加速 BWT 构建

数据结构与算法 2023-05-15 v1

摘要

由于基因组数据的指数级增长,构建专用数据结构已成为常见生物信息学应用中的主要瓶颈。特别是,Burrows-Wheeler 变换(BWT)是一些最流行的基因组数据自索引的基础,因其在重复数据上已知的良好表现。一些利用生物数据内在重复性的工具因其速度和低空间消耗而日益流行。我们引入了一种计算 BWT 的新算法,它通过 [Lipták et al., WABI 2022] 的匹配统计压缩版本(即 CMS\textit{CMS})来利用数据的冗余性。我们表明只需对一小部分后缀进行排序,即可降低计算时间和空间。我们的结果源于一个新的洞见,它将 [Lipták et al., WABI 2022] 中所谓的插入头与 BWT 已知的游程边界联系起来。我们给出了称为 CMS\texttt{CMS}-BWT\texttt{BWT} 的算法的两种实现,二者在高度重复的真实数据集上的实验验证中均具竞争力。在大多数情况下,它们运行时间优于其他工具,代价是较高的内存占用,但仍远小于输入数据的总大小。

关键词

引用

@article{arxiv.2305.07319,
  title  = {Matching Statistics speed up BWT construction},
  author = {Francesco Masillo},
  journal= {arXiv preprint arXiv:2305.07319},
  year   = {2023}
}