中文

当高层次综合遇上 FPGA HBM:基准测试与带宽优化

硬件体系结构 2020-10-14 v1

摘要

随着近期基于高带宽存储器(High Bandwidth Memory, HBM)的 FPGA 板卡的发布,开发者现在可以利用前所未有的外部存储器带宽。这使得更多受内存限制的应用能够从 FPGA 加速中受益。然而,我们发现,在使用高层次综合(high-level synthesis, HLS)工具开发某些应用时,很难充分利用可用带宽。这是由于现有 HLS 工具在访问 HBM 板卡的大量独立外部存储器通道时存在局限。在本文中,我们通过微基准测试测量了三款近期具代表性的 HBM FPGA 板卡(Intel 的 Stratix 10 MX 与 Xilinx 的 Alveo U50/U280 板卡)的性能,并分析了 HLS 开销。接下来,我们提出基于 HLS 的优化技术,以在一个处理单元(PE)访问多个 HBM 通道或多个 PE 访问一个 HBM 通道时提升有效带宽。我们的实验表明有效带宽提升了 2.4X-3.8X。我们还为未来 HBM FPGA HLS 设计流程的改进提供了一系列见解。

关键词

引用

@article{arxiv.2010.06075,
  title  = {When HLS Meets FPGA HBM: Benchmarking and Bandwidth Optimization},
  author = {Young-kyu Choi and Yuze Chi and Jie Wang and Licheng Guo and Jason Cong},
  journal= {arXiv preprint arXiv:2010.06075},
  year   = {2020}
}