中文

面向分析型数据系统形成的数据湖仓架构中数据加载与存储效率研究

分布式、并行与集群计算 2026-04-24 v1 数据库

摘要

本文研究了在三种最常用的数据湖仓系统(包括Apache Hudi、Apache Iceberg和Delta Lake)中,使用Apache Spark作为分布式数据处理平台时加载和存储数据的效率。研究分析了每个系统在处理不同大小的结构化(CSV)和半结构化(JSON)数据时的行为,包括加载大小达7 GB的文件。工作目的是根据数据源的类型和体积、使用Apache Spark的数据加载性能以及用于形成分析型数据系统的数据磁盘大小,确定最优化数据湖仓架构。研究涵盖了四个顺序ETL过程的开发,包括在每个数据湖仓系统中读取、转换和加载数据到表中。根据两个关键标准评估每个湖仓的效率:数据加载时间和文件系统中形成的表体积。首次对Apache Iceberg、Apache Hudi和Delta Lake数据湖仓系统的性能和存储进行了比较,以选择构建分析型数据系统最相关的架构。研究的实用价值在于它帮助数据工程师和架构师选择最合适的湖仓架构,理解加载性能与存储效率之间的平衡。实验结果表明,对于数据加载速度优先的任何数据量系统,Delta Lake是最优架构;而对于稳定性和磁盘空间节省至关重要的系统,Apache Iceberg最为合适。Apache Hudi在数据加载和存储评估任务中被证明效率低下,但在增量更新和流处理场景中可能有效。

关键词

引用

@article{arxiv.2604.21449,
  title  = {Research on the efficiency of data loading and storage in Data Lakehouse architectures for the formation of analytical data systems},
  author = {Ivan Borodii and Halyna Osukhivska},
  journal= {arXiv preprint arXiv:2604.21449},
  year   = {2026}
}

备注

9 pages, 2 figures, 5 tables