基于 Dagster 的高性价比大数据编排:多平台方法
分布式、并行与集群计算
2024-08-22 v1 软件工程
摘要
大数据技术的快速发展凸显了对稳健高效数据处理解决方案的需求。传统基于 Spark 的平台即服务(PaaS)解决方案,如Databricks 和 Amazon Web Services Elastic MapReduce,虽提供强大的分析能力,但常导致高运营成本和供应商锁定问题。虽然这些平台用户友好,但因其成本结构和缺乏透明定价而产生效率低下。本文介绍了使用 Dagster 的高性价比且灵活的编排框架。该解决方案旨在通过整合各种 Spark 执行环境,减少对单一 PaaS 提供商的依赖。我们展示了 Dagster 的编排能力如何提升数据处理效率、强制执行最佳编码实践,并显著降低运营成本。在我们的实现中,我们实现了比 EMR 高出 12% 的性能提升,比 DBR 降低 40% 的成本,每个管道运行可节省超过 300 欧元。我们的目标是提供一个灵活、由开发人员控制的计算环境,在保持或提高性能和可扩展性的同时,缓解与供应商锁定相关的风险。该框架支持快速原型设计和测试,这对于持续开发和运营效率至关重要,促进了大规模数据处理的可持续模式。
引用
@article{arxiv.2408.11635,
title = {Cost-Effective Big Data Orchestration Using Dagster: A Multi-Platform Approach},
author = {Hernan Picatto and Georg Heiler and Peter Klimek},
journal= {arXiv preprint arXiv:2408.11635},
year = {2024}
}