使用r-index计算最大唯一匹配
数据结构与算法
2022-05-04 v1
摘要
近年来,泛基因组因能纳入群体变异信息并缓解参考基因组偏差而受到科学界越来越多的关注。最大精确匹配(MEMs)与最大唯一匹配(MUMs)已在多个生物信息学场景中证明有用,例如短读长比对与多基因组比对。然而,使用后缀树与FM-index的标准技术无法扩展到泛基因组水平。近来,Gagie等人[JACM 20]提出了-index,一种基于Burrows-Wheeler变换(BWT)的索引,能处理数百个人类基因组。随后,Rossi等人[JCB 22]实现了使用-index计算MEMs,Boucher等人[DCC 21]展示了如何以流式方式计算它们。本文中,我们展示如何增强Boucher等人的方法,以在-index上计算MUMs,同时保持空间与时间界限。我们额外添加最长公共前缀(LCP)数组的个样本,其中为BWT的等字母游程数,使得能够计算模式后缀相对于输入文本的第二次最长匹配,进而允许计算候选MUMs。我们实现了该思路的概念验证,称为mum-phinder,并在真实数据集上测试。我们与能够计算MUMs的竞争性方法比较。我们观察到,当数据集非高度重复时,我们的方法最多小8倍,但最多慢19倍;而在高度重复数据上,我们的方法最多慢6.5倍且最多少用25倍内存。
引用
@article{arxiv.2205.01576,
title = {Computing Maximal Unique Matches with the r-index},
author = {Sara Giuliani and Giuseppe Romana and Massimiliano Rossi},
journal= {arXiv preprint arXiv:2205.01576},
year = {2022}
}
备注
Our code is available at: https://github.com/saragiuliani/mum-phinder