提升Hadoop性能的缓存机制综述
分布式、并行与集群计算
2023-10-24 v1
摘要
当今分布式计算环境中,大量数据以高速度从不同资源产生,使得现有关系数据库难以捕获、管理和处理这些数据。Hadoop是一种在分布式环境中跨机器集群并行存储和处理大型数据集的工具。Hadoop带来了灵活性、可扩展性和高容错性等诸多好处;然而,它在数据访问时间、I/O操作和重复计算方面面临一些挑战,导致额外开销、资源浪费和性能低下。许多研究者利用缓存机制来应对这些挑战。例如,他们提出了改善数据访问时间、提升数据本地化率、消除重复计算、减少I/O操作次数、降低作业执行时间以及提高资源效率的方法。在本研究中,我们提供了提升Hadoop性能的缓存策略的全面综述。此外,基于缓存利用引入了一种新颖的分类法。利用该分类,我们分析了各组对Hadoop性能的影响并讨论其优缺点。最后,提出了一种称为混合智能缓存(HIC)的新颖混合方法,它结合了来自不同组的两类方法H-SVM-LRU和CLQLMRS的优势。实验结果表明,我们的混合方法在作业执行时间上平均提升了31.2%。
引用
@article{arxiv.2310.14951,
title = {Overview of Caching Mechanisms to Improve Hadoop Performance},
author = {Rana Ghazali and Douglas G. Down},
journal= {arXiv preprint arXiv:2310.14951},
year = {2023}
}