中文

面向 GPU 上误差有界有损压缩的霍夫曼解码优化

分布式、并行与集群计算 2022-03-11 v2

摘要

越来越多的 HPC(高性能计算)应用需要快速有效的压缩技术来处理存储与传输中的海量数据。这些应用不仅需要在模拟过程中有效地压缩数据,还需要在事后分析时高效地执行解压缩。SZ 是一种面向科学数据的误差有界有损压缩器,而 cuSZ 是充分利用 GPU 算力的 SZ 版本。目前,cuSZ 的压缩性能已得到显著优化,但其解压缩性能仍因复杂的无损压缩步骤——定制的霍夫曼解码——而明显偏低。本工作中,我们旨在显著提升 cuSZ 的霍夫曼解码性能,进而改善其整体解压缩性能。为此,我们首先深入研究了两种最先进的 GPU 霍夫曼解码器。随后,我们对这两种算法提出了深入的架构优化。具体而言,我们通过以下方式充分利用 CUDA GPU 架构:在解码/写入阶段使用共享内存、在线调优所用共享内存大小、改善内存访问模式以及减少 warp 发散。最后,我们在 Nvidia V100 GPU 上使用八个代表性科学数据集评估了优化后的解码器。我们的新解码方案相较 cuSZ 的霍夫曼解码器取得了平均 3.64 倍的加速,并将其整体解压缩性能平均提升了 2.43 倍。

关键词

引用

@article{arxiv.2201.09118,
  title  = {Optimizing Huffman Decoding for Error-Bounded Lossy Compression on GPUs},
  author = {Cody Rivera and Sheng Di and Jiannan Tian and Xiaodong Yu and Dingwen Tao and Franck Cappello},
  journal= {arXiv preprint arXiv:2201.09118},
  year   = {2022}
}

备注

11 pages, 5 figures, 5 tables, accepted by IEEE IPDPS'22