中文

数据集版本管理原理:探索重建/存储权衡

数据库 2015-05-21 v1

摘要

协作数据科学和分析的相对便利性导致在许多科学和商业领域中,同一数据集出现了成千上万甚至数百万个版本,这些版本是在不同用户的数据分析各个阶段获取或构建的,并且通常跨越很长时间。管理、存储和重建这些数据集版本是一项非平凡的任务。这里的根本挑战是存储-重建权衡:使用的存储越多,重建或检索版本的速度就越快;而使用的存储越少,重建或检索版本的速度就越慢。尽管这个问题具有根本性,但令人惊讶的是,相关研究却很少。在本文中,我们以原则性的方式研究这种权衡:我们在各种设置下制定了六个问题,以各种方式权衡这些量,证明了大多数问题是难解的,并提出了一套廉价的启发式方法,这些方法借鉴了延迟约束调度和生成树文献中的技术来解决这些问题。我们构建了一个原型版本管理系统,旨在为我们的DATAHUB系统提供基础,以促进协作数据科学。通过大量实验,我们证明了所提出的启发式方法在实际数据集版本管理场景中提供了高效的解决方案。

关键词

引用

@article{arxiv.1505.05211,
  title  = {Principles of Dataset Versioning: Exploring the Recreation/Storage Tradeoff},
  author = {Souvik Bhattacherjee and Amit Chavan and Silu Huang and Amol Deshpande and Aditya Parameswaran},
  journal= {arXiv preprint arXiv:1505.05211},
  year   = {2015}
}