中文

面向生物信息大数据分析的现代数据格式

数据库 2017-07-25 v1 计算机与社会 分布式、并行与集群计算

摘要

下一代测序(Next Generation Sequencing, NGS)技术已产生海量的蛋白质组学和基因组学数据。若这些数据未被恰当分析,则毫无用处。ETL(抽取、转换、加载)是设计数据分析应用的重要步骤。ETL 需要对数据特征有恰当的理解。数据格式在理解数据、表示数据、存储数据所需空间、数据处理期间的数据 I/O、处理的中间结果、数据内存分析以及处理数据所需总时间方面起着关键作用。不同的数据挖掘和机器学习算法需要特定类型和格式的输入数据。本文探讨了不同工具和算法所使用的数据格式,并提出了在大数据平台(Big Data Platform)上使用的现代数据格式。它将帮助研究人员和开发者为特定工具或算法选择适当的数据格式。

关键词

引用

@article{arxiv.1707.05364,
  title  = {Modern Data Formats for Big Bioinformatics Data Analytics},
  author = {Shahzad Ahmed and M. Usman Ali and Javed Ferzund and Muhammad Atif Sarwar and Abbas Rehman and Atif Mehmood},
  journal= {arXiv preprint arXiv:1707.05364},
  year   = {2017}
}

备注

12 Pages, 20 figures and 2 Tables