中文

利用德布鲁因图的欧拉覆盖和BWT实现高效的k-mer数据集压缩

组合数学 2025-10-28 v1

摘要

将输入序列转换为其组成k-mer是计算基因组学中的一项基本操作。为了降低与k-mer数据集相关的存储成本,我们引入并正式分析了MCTR,一种用于k-mer多重集无损压缩的新型两阶段算法。我们的核心方法通过计算数据集德布鲁因图的最优欧拉覆盖(最小字符串计数)来实现最小文本表示(W),这得益于一种高效的局部欧拉化技术。然后使用Burrows-Wheeler变换(BWT)对生成的字符串进行进一步无损压缩。利用德布鲁因图的性质,MCTR被证明具有线性的时间和空间复杂度,并保证原始k-mer多重集(包括频率)的完全重建。使用模拟和真实基因组数据,我们评估了MCTR(列表和频率表示)相对于最先进的有损unitigging工具greedytigs(来自matchtigs)的性能。我们测量了核心执行时间和原始压缩比cmpr = weight(M)/weight(W),其中M是输入序列数据)。基准测试证实了MCTR的数据保真度,但揭示了无损表示固有的性能权衡。GreedyTigs明显更快。在原始压缩方面,GreedyTigs在其有损序列输出上对嘈杂的真实数据实现了高压缩比(cmpr约14)。在真实数据上,MCTR(频率)显示出适度的原始压缩(cmpr约1.5-2.7),而MCTR(列表)则没有(cmpr约1)。重要的是,完整的MCTR+BWT流水线在增强无损压缩方面显著优于单独的BWT。我们的结果确立了MCTR作为针对需要高效、无损存储和分析k-mer多重集的应用的一个有价值的、有理论依据的工具,补充了针对序列摘要优化的有损方法。

关键词

引用

@article{arxiv.2510.22404,
  title  = {Efficient k-mer Dataset Compression Using Eulerian Covers of de Bruijn Graphs and BWT},
  author = {H. Z. Q. Chen and S. Kitaev and X. Lang and A. Pyatkin and R. Tang},
  journal= {arXiv preprint arXiv:2510.22404},
  year   = {2025}
}

备注

To appear in RAIRO - Theoretical Informatics and Applications