中文

FPGA覆盖层的乱序数据流调度

硬件体系结构 2017-05-09 v1

摘要

我们利用Arria10 FPGA中的浮点DSP和M20K RAM的多泵浦特性,为大型图工作负载构建了一个数据流驱动的软处理器结构。在本文中,我们通过结合高效的节点标记方案和领先一检测器电路,引入了在每个处理器内大量本地节点(数千个)上的乱序节点调度思想。我们使用静态一次性节点标记算法,根据关键性对节点进行排序,以组织每个软处理器内部的本地内存。这转化为约6%的小内存开销。与先前研究中使用的内存昂贵的基于FIFO的先到先服务方法相比,我们提供了高达50%的性能提升,同时消除了FIFO的成本。在Arria10 10AX115S板上,我们可以创建多达300个处理器的覆盖设计,通过高带宽Hoplite NoC连接,频率高达250MHz。

关键词

引用

@article{arxiv.1705.02734,
  title  = {Out-of-Order Dataflow Scheduling for FPGA Overlays},
  author = {Siddhartha and Nachiket Kapre},
  journal= {arXiv preprint arXiv:1705.02734},
  year   = {2017}
}

备注

Presented at 3rd International Workshop on Overlay Architectures for FPGAs (OLAF 2017) arXiv:1704.08802