中文

给定字典序最小化子的k-mer数量研究

数据结构与算法 2024-12-25 v2 离散数学 组合数学

摘要

k-mer(大小为k的子串)的最小化子定义为其大小为m(m≤k)的子串中按字典序最小者。最小化子在生物信息学中用于分区,将共享相同最小化子的k-mer归为一类。使用字典序时,分区极度不平衡,导致大量文献致力于寻找替代序方式以实现更平衡的分区。据我们所知,字典序基于的最小化子分区的不平衡性从理论角度从未被考察。本文旨在填补这一空白,确定给定最小化子会容纳多少k-mer——即在最坏情况下(所有k-mer均出现于数据中)与该最小化子相关联的桶的大小。我们表明该数字可在O(km)空间和O(km²)时间内计算。我们进一步引入可在O(k)空间和O(km)时间内计算的近似方法。我们还在基因组数据集上表明,实际上与最小化子相关联的k-mer数量与理论预期值 closely 相关。我们提出两个猜想,可帮助近似估计共享最小化子的k-mer总数。我们认为 characterize 每个最小化子所属k-mer的分布将有助于设计高效的字典序最小化子分桶方法。

关键词

引用

@article{arxiv.2412.17492,
  title  = {On the number of $k$-mers admitting a given lexicographical minimizer},
  author = {Florian Ingels and Camille Marchet and Mikaël Salson},
  journal= {arXiv preprint arXiv:2412.17492},
  year   = {2024}
}