中文

基于 MPI 与 GPU 的 MapReduce 词频统计

分布式、并行与集群计算 2022-06-14 v1

摘要

在本项目中,目标是使用 Julia 编程语言和并行化编写快速的 MapReduce 算法,以统计大量文档中的词频。我们首先在使用 MPI 的两个进程的 CPU 上实现词频统计算法。然后,我们创建了另一种实现,但在使用 Julia CUDA 库的 GPU 上,尽管未使用 FoldsCUDA.jl 中内置的 MapReduce 算法。此后,我们将 CPU 和 GPU 算法应用于统计 George W Bush、Barack H Obama、Donald J Trump 和 Joseph R Biden 等总统演讲中的词频,旨在发现可用于唯一识别每位总统的用词模式。我们发现每位总统确实有一些比其他总统明显更常使用的词,且考虑到当时的政治气候,这些词并不令人意外。本项目的目标是创建比先前已实现的更快的 Julia CPU 和 GPU 上的 MapReduce 算法。我们给出了一些简单映射函数的案例,其中我们的 GPU 算法优于 Julia 的 FoldsCUDA 实现。我们还讨论了针对文档词频统计及这些特定映射函数的进一步优化思路。

关键词

引用

@article{arxiv.2206.05269,
  title  = {MapReduce for Counting Word Frequencies with MPI and GPUs},
  author = {Nithin Kavi},
  journal= {arXiv preprint arXiv:2206.05269},
  year   = {2022}
}