模体发现的 Map-Reduce 并行化
分布式、并行与集群计算
2014-05-05 v1 计算工程、金融与科学
摘要
模体发现是当今生物信息学中最具挑战性的问题之一。DNA 序列模体在基因调控分析中变得日益重要。模体是 DNA 中具有生物功能的短重复模式;例如,它们指示转录因子(TFs)和核酸酶的结合位点。目前有许多顺序运行的模体发现算法,其顺序特性阻碍了这些算法的并行化。HOMER 就是这样一种模体发现工具,我们决定使用它来克服这一局限。为此,我们提出了一种利用 HOMER 进行模体发现的新方法,对该任务进行了并行化处理。并行化版本有望提供更好的可扩展性和性能。为实现这一目标,我们决定采用子抽样和 Map-Reduce 模型。在每个 Map 节点,输入 DNA 序列的子抽样版本被用作 HOMER 的输入。每个 map 节点的子抽样采用不同的参数执行,以确保没有两个 HOMER 实例接收相同的输入。Map 阶段的输出和 Reduce 阶段的输入是使用子抽样序列发现的模体列表。Reduce 阶段计算众数,即最频繁的模体,并将其作为最终发现的模体输出。我们发现,这种执行模型带来了微小的速度提升,但在发现的模体质量上造成了 substantial amount 的损失。
引用
@article{arxiv.1405.0354,
title = {Map-Reduce Parallelization of Motif Discovery},
author = {Umang Vipul},
journal= {arXiv preprint arXiv:1405.0354},
year = {2014}
}
备注
4 pages, 1 figure, 6 tables