在KATKA核与最小化子摘要中使用最大精确匹配进行物种分类
数据结构与算法
2024-04-08 v2 基因组学
种群与进化
摘要
对于物种分类,我们需要为系统发育树中的基因组建立索引,以便后续给定一个DNA读段时,能快速选择一个可能包含该读段来源基因组的小子树。尽管像Kraken这样的流行分类器使用k-mer,但最近的研究表明,使用最大精确匹配(MEM)可以实现更好的分类。例如,我们可以为按从左到右顺序串联的树中基因组构建一个增强的FM索引;对于读段中的每个MEM,在后缀数组中找到包含该MEM在那些基因组中出现起始位置的区间;找到该区间中存储的最小值和最大值;取包含这些位置字符的基因组的最低共同祖先(LCA)。然而,这种解决方案仅在树中基因组的总大小相当小时才实用。在本文中,我们考虑将相同的解决方案应用于基因组串联的三种有损压缩表示:KATKA内核,它丢弃不在任何k_max元组的首次或末次出现中的字符,参数为k_max;最小化子摘要;最小化子摘要的KATKA内核。通过一个测试数据集及其这三种表示、模拟读段和各种参数设置,我们检查了多少读段的最长MEM仅出现在生成这些读段的序列中(“真阳性”读段)。对于某些参数设置,我们在仅略微降低真阳性率的情况下实现了显著的压缩。
引用
@article{arxiv.2402.06935,
title = {Taxonomic classification with maximal exact matches in KATKA kernels and minimizer digests},
author = {Dominika Draesslerová and Omar Ahmed and Travis Gagie and Jan Holub and Ben Langmead and Giovanni Manzini and Gonzalo Navarro},
journal= {arXiv preprint arXiv:2402.06935},
year = {2024}
}