中文

引入数据原语:SKED 框架的数据格式

定量方法 2017-06-27 v1

摘要

背景:过去几年中,数据集的规模和复杂性急剧增加。科学与临床研究必须纳入跨越多个空间和时间尺度的数据集,以描述特定现象。如何以一种对研究人员有用且可扩展至新数据类型的方式来存储和访问这些异构数据集,是一项重大挑战。方法:为了克服这些障碍,我们提出将数据原语作为分析方法之间的通用媒介。我们确定的四种数据原语是时间序列、文本、标注图和三角化网格,并带有相关元数据。仅使用数据原语来存储数据以及作为算法的输入、输出和中间结果,可促进科学研究中的互操作性、可扩展性和可重复性。结果:数据原语被用于一项针对非人类灵长动物疟疾感染的多组学、多尺度系统生物学研究中,以快速高效地执行多种类型的整合分析。结论:将数据原语作为数据存储以及分析方法间交互的通用媒介,能够以可重复的模块化方式分析复杂的多组学、多尺度数据集。

关键词

引用

@article{arxiv.1706.08131,
  title  = {Introducing Data Primitives: Data Formats for the SKED Framework},
  author = {Elizabeth D. Trippe and Jacob B. Aguilar and Yi H. Yan and Mustafa V. Nural and Jessica A. Brady and Juan B. Gutierrez},
  journal= {arXiv preprint arXiv:1706.08131},
  year   = {2017}
}

备注

10 pages, 3 figures