中文

面向太碱基的Burrows-Wheeler变换

数据结构与算法 2016-01-15 v2

摘要

为了避免将读段映射到参考基因组所引入的参考偏差,生物信息学家正在研究用于分析已测序基因组的无参考方法。随着大型项目对数以千计的个体进行测序,这产生了能够处理太碱基(terabases)级序列数据的工具需求。一种关键方法是Burrows-Wheeler变换(BWT),它被广泛用于读段的压缩和索引。我们提出了一种实用算法,通过合并子集合的BWT来构建大型读段集合的BWT。对于我们的2.4 Tbp数据集,该算法在单一系统上能以每天600 Gbp的速度进行合并,并在游程编码BWT的基础上使用30 GB的内存开销。

关键词

引用

@article{arxiv.1511.00898,
  title  = {Burrows-Wheeler transform for terabases},
  author = {Jouni Sirén},
  journal= {arXiv preprint arXiv:1511.00898},
  year   = {2016}
}

备注

This is the full version of the paper that was accepted to DCC 2016. The implementation is available at https://github.com/jltsiren/bwt-merge