中文

通过无前缀解析加速 FM-index 查询

数据结构与算法 2023-05-11 v1

摘要

FM-index 是 DNA 比对中的关键数据结构,但利用其进行搜索通常对查询模式中的每个字符至少需一次随机访问。Ferragina 与 Fischer 于 2007 年观察到,基于词的索引往往比基于字符的索引使用更少的随机访问,从而支持更快的搜索。然而,由于 DNA 缺乏自然的词边界,在应用基于词的 FM-indexing 之前有必要以某种方式对其解析。去年,Deng 等人提出通过诱导后缀排序解析基因组数据,并表明当模式长度为数千字符或更长时,所得基于词的 FM-index 比标准 FM-index 支持更快的计数查询。本文中我们表明,使用无前缀解析——其参数可调节短语平均长度——替代诱导后缀排序,可对仅数百字符长的模式带来显著加速。我们实现了该方法,并证明在针对 GRCh38 的查询上其比竞争方法快 3 至 18 倍。且在针对 25,000、50,000 与 100,000 个 SARS-CoV-2 基因组的查询上始终更快。因此,很明显我们的方法以微小的内存增加加速了所有最先进方法的计数性能。我们的源代码见于 https://github.com/marco-oliva/afm 。

关键词

引用

@article{arxiv.2305.05893,
  title  = {Acceleration of FM-index Queries Through Prefix-free Parsing},
  author = {Aaron Hong and Marco Oliva and Dominik Köppl and Hideo Bannai and Christina Boucher and Travis Gagie},
  journal= {arXiv preprint arXiv:2305.05893},
  year   = {2023}
}