中文

关于相同XOR基Minimizer的k-mers个数的Vigemers

离散数学 2026-02-04 v1 数据结构与算法 组合数学

摘要

在生物信息学中,minimizer 已成为处理从DNA或RNA测序中提取的k-mers(固定大小k的词)不可避免的方法,无论是用于抽样、存储、查询还是分区。根据某种固定顺序对m-mers(m<k),k-mers的minimizer定义为其最小m-mers——并充当其指纹。虽然minimizer被广泛用于分区目的,但几乎没有关于所得分区质量的理论工作。例如,已知多年 lexicographic 顺序在实证上导致高度不平衡的分区,而在实际中不可用,但直到最近,才有人对这一观察进行了理论论证。对lexicographic顺序的拒绝导致社区诉诸(伪)随机顺序使用哈希函数。本文扩展了关于由lexicographic顺序获得的分区的理论结果,转向一个(指数级)大型哈希函数族,即m-mers被异或到固定密钥。更准确地说,给定密钥 γ\gamma 和m-mers ww,我们研究计数函数,即多少个k-mers将ww作为其minimizer(即wγw\oplus\gamma在该k-mers的所有m-mers中最小)。这个数字记作 πkγ(w)\pi_k^{\gamma}(w),代表如果所有可能的k-mers都被看到并进行分区,与ww相关联的bucket的最大大小。我们采用(lexicographic顺序)文献中的方法来适应我们的框架,提出组合方程,允许使用动态规划在 O(km2)O(km^2) 时间复杂度和 O(km)O(km) 空间复杂度内计算 πkγ(w)\pi_k^{\gamma}(w)

关键词

引用

@article{arxiv.2602.03337,
  title  = {Vigemers: on the number of $k$-mers sharing the same XOR-based minimizer},
  author = {Florian Ingels and Antoine Limasset and Camille Marchet and Mikaël Salson},
  journal= {arXiv preprint arXiv:2602.03337},
  year   = {2026}
}