利用 D4M 大数据方法进行遗传序列比对
定量方法
2016-11-18 v2 基因组学
摘要
下一代测序 (Next Generation Sequencing) 工具的最新技术进步提高了 DNA 样本采集、制备和测序的速度。一台仪器在单次运行中可产生超过 600 Gb 的遗传序列数据。这为高效处理日益增加的工作量带来了新机遇。我们提出了一种利用动态分布式多维数据模型 (Dynamic Distributed Dimensional Data Model, D4M) 进行快速遗传序列分析的新方法;D4M 是由麻省理工学院林肯实验室 (MIT Lincoln Laboratory) 开发的用于 MATLAB 的关联数组环境。基于数学和统计特性,该方法利用大数据技术并实施 Apache Accumulo 数据库,使计算速度比其他方法加速一百倍。将 D4M 方法与当前序列分析的金标准 BLAST 进行比较,结果显示两者在发现的比对结果上具有可比性。本文将概述 D4M 遗传序列算法及其与 BLAST 的统计比较。
引用
@article{arxiv.1407.6923,
title = {Genetic Sequence Matching Using D4M Big Data Approaches},
author = {Stephanie Dodson and Darrell O. Ricke and Jeremy Kepner},
journal= {arXiv preprint arXiv:1407.6923},
year = {2016}
}
备注
6 pages; to appear in IEEE High Performance Extreme Computing (HPEC) 2014