中文

面向 Hadoop 的 SVM-LRU (H-SVM-LRU):一种提升 MapReduce 性能的智能缓存替换算法

分布式、并行与集群计算 2023-09-29 v1

摘要

现代应用能够从不同的来源以高速率生成大量数据,这种组合难以通过传统工具存储和处理。Hadoop 是一种用于在分布式环境中并行处理大量数据的框架,然而各种挑战会导致其性能不佳。两个尤其限制性能的问题是 I/O 操作的高访问时间以及中间数据的重复计算。这两个问题的结合会造成资源浪费。近年来,已有一些尝试通过使用缓存机制来克服这些问题。由于缓存空间有限,高效利用该空间并避免缓存污染(缓存包含未来不会被使用的数据)至关重要。我们提出了面向 Hadoop 的 SVM-LRU(H-SVM-LRU)以提升 Hadoop 性能。为此,我们使用了一种智能缓存替换算法 SVM-LRU,它将著名的 LRU 机制与机器学习算法 SVM 相结合,依据未来使用情况将缓存数据分为两类。实验结果表明,由于缓存命中率提高,执行时间显著减少,从而对 Hadoop 性能产生了积极影响。

关键词

引用

@article{arxiv.2309.16471,
  title  = {Hadoop-Oriented SVM-LRU (H-SVM-LRU): An Intelligent Cache Replacement Algorithm to Improve MapReduce Performance},
  author = {Rana Ghazali and Sahar Adabi and Ali Rezaee and Douglas G. Down and Ali Movaghar},
  journal= {arXiv preprint arXiv:2309.16471},
  year   = {2023}
}