中文

PIM-FW: DRAM中全对最短路径的软硬件协同设计

硬件体系结构 2025-12-23 v1

摘要

全对最短路径是一种用于路由、物流和网络分析的基础算法,但经典Floyd-Warshall算法的三次时间复杂度和大量数据移动严重限制了其在传统CPU或GPU上的可扩展性。在本文中,我们提出了PIM-FW,一种新颖的协同设计硬件架构和数据流,利用存内和近存计算架构,旨在HBM3堆栈上加速分块FW算法。为了实现细粒度并行性,我们提出了一种大规模并行的专用位串行bank PE和channel PE阵列,旨在加速核心的min-plus运算。我们的新颖数据流补充了该硬件,采用交错映射策略实现卓越的负载均衡,以及混合存内和近存计算模型实现高效计算和归约。新颖的存内计算方式允许所有距离更新在存储bank内执行和存储,一个关键贡献是消除了基于GPU方法中固有的数据移动瓶颈。我们使用周期精确模拟器在真实路网轨迹上模拟了一个8通道、4-Hi HBM3 PIM堆栈,实现了完整的软件和硬件协同设计。实验结果表明,对于一个8192 x 8192的图,与最先进的纯GPU Floyd-Warshall相比,PIM-FW在端到端执行中实现了18.7倍的加速,并消耗了3200倍更少的DRAM能量。

关键词

引用

@article{arxiv.2512.18158,
  title  = {PIM-FW: Hardware-Software Co-Design of All-pairs Shortest Paths in DRAM},
  author = {Tsung-Han Lu and Zheyu Li and Minxuan Zhou and Tajana Rosing},
  journal= {arXiv preprint arXiv:2512.18158},
  year   = {2025}
}