面向太碱基的Burrows-Wheeler变换
数据结构与算法
2016-01-15 v2
摘要
为了避免将读段映射到参考基因组所引入的参考偏差,生物信息学家正在研究用于分析已测序基因组的无参考方法。随着大型项目对数以千计的个体进行测序,这产生了能够处理太碱基(terabases)级序列数据的工具需求。一种关键方法是Burrows-Wheeler变换(BWT),它被广泛用于读段的压缩和索引。我们提出了一种实用算法,通过合并子集合的BWT来构建大型读段集合的BWT。对于我们的2.4 Tbp数据集,该算法在单一系统上能以每天600 Gbp的速度进行合并,并在游程编码BWT的基础上使用30 GB的内存开销。
引用
@article{arxiv.1511.00898,
title = {Burrows-Wheeler transform for terabases},
author = {Jouni Sirén},
journal= {arXiv preprint arXiv:1511.00898},
year = {2016}
}
备注
This is the full version of the paper that was accepted to DCC 2016. The implementation is available at https://github.com/jltsiren/bwt-merge