中文

基因组序列大数据集分析:k-mer统计的快速可扩展收集

分布式、并行与集群计算 2018-07-05 v1

摘要

由于下一代测序技术产生了大量数据,基于 map-reduce 编程范式的分布式方法已开始被提出用于生物信息学领域。然而,就效率和有效性而言,map-reduce 及相关大数据技术和框架(例如 Apache Hadoop 和 Spark)的使用并不一定产生令人满意的结果。我们讨论了分布式和大数据管理技术的发展如何影响对大型生物序列数据集的分析。此外,我们展示了不同参数配置的选择以及针对所考虑的特定框架对软件进行细致的工程化设计,对于在极大量数据上获得良好性能可能是至关重要的。我们选择 k-mer 计数作为我们分析的一个案例研究,并选择 Spark 作为实现 FastKmer 的框架,FastKmer 是一种从任意 kk 值的大型生物序列集合中提取 k-mer 统计的新方法。FastKmer 最相关的贡献之一是引入了一个模块,用于在计算集群的节点上平衡统计聚合工作负载,以克服数据偏斜,同时充分利用底层分布式架构。我们还展示了一项比较实验分析的结果,表明我们的方法目前是基于大数据技术的方法中最快的,同时表现出非常好的可扩展性。我们提供的证据表明,只有当算法设计和实现中仔细考虑架构细节和所考虑框架的特殊方面时,使用 Hadoop 或 Spark 等技术来分析生物序列大数据集才是富有成效的。

关键词

引用

@article{arxiv.1807.01566,
  title  = {Analyzing Big Datasets of Genomic Sequences: Fast and Scalable Collection of k-mer Statistics},
  author = {Umberto Ferraro Petrillo and Mara Sorella and Giuseppe Cattaneo and Raffaele Giancarlo and Simona Rombo},
  journal= {arXiv preprint arXiv:1807.01566},
  year   = {2018}
}