关于相同XOR基Minimizer的k-mers个数的Vigemers
离散数学
2026-02-04 v1 数据结构与算法
组合数学
摘要
在生物信息学中,minimizer 已成为处理从DNA或RNA测序中提取的k-mers(固定大小k的词)不可避免的方法,无论是用于抽样、存储、查询还是分区。根据某种固定顺序对m-mers(m<k),k-mers的minimizer定义为其最小m-mers——并充当其指纹。虽然minimizer被广泛用于分区目的,但几乎没有关于所得分区质量的理论工作。例如,已知多年 lexicographic 顺序在实证上导致高度不平衡的分区,而在实际中不可用,但直到最近,才有人对这一观察进行了理论论证。对lexicographic顺序的拒绝导致社区诉诸(伪)随机顺序使用哈希函数。本文扩展了关于由lexicographic顺序获得的分区的理论结果,转向一个(指数级)大型哈希函数族,即m-mers被异或到固定密钥。更准确地说,给定密钥 和m-mers ,我们研究计数函数,即多少个k-mers将作为其minimizer(即在该k-mers的所有m-mers中最小)。这个数字记作 ,代表如果所有可能的k-mers都被看到并进行分区,与相关联的bucket的最大大小。我们采用(lexicographic顺序)文献中的方法来适应我们的框架,提出组合方程,允许使用动态规划在 时间复杂度和 空间复杂度内计算 。
引用
@article{arxiv.2602.03337,
title = {Vigemers: on the number of $k$-mers sharing the same XOR-based minimizer},
author = {Florian Ingels and Antoine Limasset and Camille Marchet and Mikaël Salson},
journal= {arXiv preprint arXiv:2602.03337},
year = {2026}
}