中文

早期设计空间探索与粗粒度合并加速器的自动生成

硬件体系结构 2021-11-18 v1

摘要

后摩尔定律时代面积受限的系统依赖加速器来提供性能提升。粗粒度加速器可提供显著的领域加速,但手动、临时的加速代码识别成本高得令人望而却步。由于周期精确模拟器和高层次综合(HLS)流程非常耗时,手动创建利用最优粒度下控制与数据流模式的高利用率加速器很少成功。为应对这些挑战,我们提出AccelMerger,这是首个用于创建粗粒度、富含控制与数据流、合并加速器的自动化方法。AccelMerger使用序列比对匹配来识别相似的函数调用图和循环,并使用神经网络快速评估它们经HLS后的特性。它准确识别应加速的函数,并合并加速器以遵守面积预算并适应系统通信特性(如延迟和带宽)。合并两个加速器可节省多达其中一个99%的面积。节省的空间由全局最优整数线性规划用于分配更多加速器以提升性能。我们展示了AccelMerger在HLS流程下的有效性,无需任何手动微调所得设计。在基于FPGA的系统上,AccelMerger相较软件实现带来高达16.7倍的性能提升,且相较最先进的早期阶段设计空间探索(DSE)工具平均提升1.91倍。

关键词

引用

@article{arxiv.2111.09222,
  title  = {Early DSE and Automatic Generation of Coarse Grained Merged Accelerators},
  author = {Iulian Brumar and Georgios Zacharopoulos and Yuan Yao and Saketh Rama and Gu-Yeon Wei and David Brooks},
  journal= {arXiv preprint arXiv:2111.09222},
  year   = {2021}
}