面向泛基因组读段比对完整索引的高效构建
数据结构与算法
2018-11-19 v1
摘要
以 FM-index 为主的短读段比对器能够轻松索引一个或少数几个人类基因组,但扩展到包含数千个基因组的数据库时扩展性不佳。要理解其原因,需更细致地考察 FM-index 的主要组成部分:其一,是在字符串的 Burrows-Wheeler 变换(BWT)上的秩数据结构,可让我们找到字符串后缀数组(SA)中包含给定模式出现起始位置指针的区间;其二,是 SA 的一个样本——当与秩数据结构配合使用时——可让我们访问 SA。通过对 BWT 进行游程压缩,即使对于大型基因组数据库,秩数据结构也能保持较小体积,但直到最近,人们仍不知如何在不大幅拖慢 SA 访问的前提下保持 SA 样本小巧。如今 Gagie 等人(SODA 2018)已定义了一种占用空间与游程压缩 BWT 大致相当的 SA 样本——我们由此获得了基因组数据库高效 FM-index 的设计,却面临构建它们的难题。2018 年我们展示了如何高效构建大型基因组数据库的 BWT(WABI 2018),但高效构建 Gagie 等人 SA 样本的问题仍悬而未决。我们将我们的方法与构建 SA 样本的最先进方法进行比较,并证明在高重复基因组数据库上它是最快且最节省空间的方法。最后,我们将方法应用于索引部分及完整人类基因组,并显示其在内存与时间上均优于 Bowtie。
引用
@article{arxiv.1811.06933,
title = {Efficient Construction of a Complete Index for Pan-Genomics Read Alignment},
author = {Alan Kuhnle and Taher Mun and Christina Boucher and Travis Gagie and Ben Langmead and Giovanni Manzini},
journal= {arXiv preprint arXiv:1811.06933},
year = {2018}
}