中文

BioWorkbench:用于管理和分析生物信息学实验的高性能框架

分布式、并行与集群计算 2018-09-03 v1 数据库

摘要

测序技术的进步导致了生物数据的指数级增长,要求开展大规模生物信息学实验。由于这些实验计算密集且数据密集,它们需要高性能计算(HPC)技术,并可从科学工作流管理系统(SWfMS)和数据库等专门技术中受益。在本文中,我们提出 BioWorkbench,一个用于管理和分析生物信息学实验的框架。该框架自动收集溯源数据,包括工作流执行的性能数据和来自工作流应用科学领域的数据。溯源数据可通过一个 web 应用进行分析,该应用抽象出对溯源数据库的一组查询,简化了对溯源信息的访问。我们使用三个案例研究评估 BioWorkbench:SwiftPhylo,一个系统发育树构建工作流;SwiftGECKO,一个比较基因组学工作流;以及 RASflow,一个 RASopathy 分析工作流。我们通过使用对溯源和注释数据库的查询,从计算和科学领域两个角度分析每个工作流。其中一些查询作为 BioWorkbench web 应用的预构建功能提供。通过溯源数据,我们表明该框架具有可扩展性并实现高性能,将案例研究的执行时间最多减少 98%。我们还展示了机器学习技术的应用如何丰富分析过程。

关键词

引用

@article{arxiv.1801.03915,
  title  = {BioWorkbench: A High-Performance Framework for Managing and Analyzing Bioinformatics Experiments},
  author = {Maria Luiza Mondelli and Thiago Magalhães and Guilherme Loss and Michael Wilde and Ian Foster and Marta Mattoso and Daniel S. Katz and Helio J. C. Barbosa and Ana Tereza R. Vasconcelos and Kary Ocaña and Luiz M. R. Gadelha},
  journal= {arXiv preprint arXiv:1801.03915},
  year   = {2018}
}