中文

比对读集的压缩与索引

数据结构与算法 2021-06-02 v5 基因组学

摘要

在本文中,我们展示了如何以一个或多个已组装或部分组装的基因组为基础,为其读集构建压缩的全文索引。具体而言,我们以组装基因组为主干构建一棵带标签的树,并将比对到该基因组的读段按其比对的起始位置嫁接上去。接着,我们计算所得带标签树的扩展Burrows-Wheeler变换(XBWT),并基于此构建压缩的全文索引。尽管该索引偶尔会返回假阳性,但其通常比替代方案紧凑得多。遵循针对多重复数据集的既定做法,我们通过考察变换后字符串中的游程数来比较不同的全文索引。对于人类19号染色体读集,我们的初步实验表明,从EBWT中去除分隔符字符可将游程数减少19%,从2.2亿降至1.78亿,而使用XBWT进一步减少15%,降至1.5亿。

关键词

引用

@article{arxiv.1809.07320,
  title  = {Compressing and Indexing Aligned Readsets},
  author = {Travis Gagie and Garance Gourdel and Giovanni Manzini},
  journal= {arXiv preprint arXiv:1809.07320},
  year   = {2021}
}