中文

TeraNoC:面向 1000+ 核共享 L1 存储集群的多通道 32 位细粒度混合网格-交叉bar NoC

分布式、并行与集群计算 2025-08-05 v1

摘要

芯片互连设计的关键挑战之一是在保持低时延和高面积效率的同时扩展带宽。2D 网格因低布线面积和拥塞开销而规模化,但其端到端时延随跳数增加而不适用于面向时延敏感的核心到 L1 存储访问。相反,交叉bar提供低时延,但其路由复杂度随 I/O 数量的平方增长,需大量物理布线资源,限制面积效率的规模化。这种双向互连瓶颈阻碍了众多核、低时延、紧密耦合共享存储集群的规模化,使设计师倾向于实例化许多个较小且松耦合的集群,增加硬件和软件开销。我们提出 TeraNoC,一种开源的混合网格-交叉bar芯片互连,既具可扩展性又具低时延,同时保持极低的路由开销。该拓扑基于 32 位字宽多通道 2D 网格和交叉bar,实现共享存储集群的面积高效规模化。设计了一个路由映射器,用于在互连通道之间均衡流量负载。使用 TeraNoC,我们构建了一个包含 1024 个单级、单发射核心的集群,共享 4096 银行 L1 存储,采用 12nm 制程实现。低互连停顿使计算密集型、数据并行关键 GenAI 内核实现最高 0.85 IPC 的高计算利用率。TeraNoC 在以交叉bar访问为主导的内核中仅占总能耗的 7.6%,在高 2D 网格流量的内核中占 22.7%。相较于层次化仅用交叉bar的集群,TeraNoC 降低 die 面积 37.8%,提升面积效率(GFLOP/s/mm2)最高可达 98.7%,仅占逻辑面积的 10.9%。

关键词

引用

@article{arxiv.2508.02446,
  title  = {TeraNoC: A Multi-Channel 32-bit Fine-Grained, Hybrid Mesh-Crossbar NoC for Efficient Scale-up of 1000+ Core Shared-L1-Memory Clusters},
  author = {Yichao Zhang and Zexin Fu and Tim Fischer and Yinrong Li and Marco Bertuletti and Luca Benini},
  journal= {arXiv preprint arXiv:2508.02446},
  year   = {2025}
}

备注

8 pages, 9 figures. Proceeded by The 43rd IEEE International Conference on Computer Design (ICCD 2025)