中文

存储与否:一种用于数据集版本控制的图论方法

数据结构与算法 2024-02-20 v1 计算复杂性 数据库 分布式、并行与集群计算

摘要

在本工作中,我们研究了成本效益高的数据版本控制问题,其目标是在给定以数据集为节点、以捕获编辑/增量信息的边构成的图的情况下,优化数据版本的存储和重建(检索)成本。我们研究的一个核心变体是 MinSum Retrieval (MSR),其目标是在保持存储成本有界的同时最小化总检索成本。这个问题(及其变体)由 Bhattacherjee 等人 [VLDB'15] 提出。虽然此类问题经常出现在协作工具(例如版本控制系统和数据分析管道)中,但据我们所知,现有研究尚未探讨这些问题的理论方面。我们证明了目前最著名的启发式算法 LMG 在简单的最坏情况下表现可能任意差。此外,我们表明,即使将存储约束放宽 O(logn)O(\log n) 倍,在一般图上获得 MSR 的 o(n)o(n) 近似也是困难的。其他变体也显示了类似的硬度结果。同时,受实践中典型编辑操作产生的图通常并非任意的这一事实启发,我们提出了针对树状图的多项式时间近似方案。由于版本图通常具有低树宽,我们进一步开发了针对有界树宽图的新算法。此外,我们提出了两种新的启发式算法并进行了经验评估。首先,我们通过考虑更多潜在的“移动”来扩展 LMG,提出了一种新的启发式算法 LMG-All。LMG-All 在各种数据集(即版本图)上始终优于 LMG,同时具有相当的运行时间。其次,我们将我们的树算法应用于实例的最小存储有向树,生成的算法在 MSR 以及另一个变体 BoundedMin Retrieval (BMR) 方面,在质量上优于所有先前的启发式算法。

关键词

引用

@article{arxiv.2402.11741,
  title  = {To Store or Not to Store: a graph theoretical approach for Dataset Versioning},
  author = {Anxin Guo and Jingwei Li and Pattara Sukprasert and Samir Khuller and Amol Deshpande and Koyel Mukherjee},
  journal= {arXiv preprint arXiv:2402.11741},
  year   = {2024}
}

备注

Accepted by IPDPS 2024