中文

HAlign-II:基于分布式与并行计算的高效超大规模多序列比对与系统发育树重建

分布式、并行与集群计算 2017-04-05 v1 定量方法

摘要

多序列比对(MSA)在生物序列分析中起着关键作用,特别是在系统发育树构建中。下一代测序技术的极度增长导致缺乏能够应对不同序列类型的高效超大规模生物序列比对方法。分布式与并行计算是加速超大规模序列分析的关键技术。基于 HAlign 和 Spark 分布式计算系统,我们实现了一个具有高性价比和时间效率的 HAlign-II 工具,以解决超大规模生物多序列比对和系统发育树构建问题。通过与现有大多数最先进的方法进行比较,我们的实验结果表明:1) HAlign-II 能够高效地对超大规模生物序列进行 MSA 并构建系统发育树;2) HAlign-II 表现出极高的内存效率,并且能随计算资源的增加而良好扩展;3) HAlign-II 基于我们的分布式计算基础设施提供了一个用户友好的网络服务器。HAlign-II 的开源代码和数据集已发布于 http://lab.malab.cn/soft/halign。

关键词

引用

@article{arxiv.1704.00878,
  title  = {HAlign-II: efficient ultra-large multiple sequence alignment and phylogenetic tree reconstruction with distributed and parallel computing},
  author = {Shixiang Wan and Quan Zou},
  journal= {arXiv preprint arXiv:1704.00878},
  year   = {2017}
}