TeraPool:面向物理实现的 1024 核共享 L1 存储规模化集群设计
摘要
共享 L1 存储的简化指令处理器(处理单元 - PE)是现代大规模并行计算架构(如 GP-GPU)中的常见构建模块。通过增加集群数量来扩展这些架构会导致计算和功耗开销,因为需要将大型数据结构分块处理并通过高延迟全局互联将数据块跨越内存层次移动。规模化集群可减少缓冲、复制和同步开销。然而,完全连接的核心到 L1 存储交叉开关的复杂度随着 PE 数量的呈二次增长,这构成了主要的物理实现挑战。我们提出了 TeraPool,一种可物理实现的、拥有超过 1000 个具浮点能力的 RISC-V PE 的规模化集群设计,共享通过低延迟层次化互联(取决于目标频率,在 1-7/9/11 周期)访问的 Multi-MegaByte 超过 4000 银行的 L1 存储。采用 12nm FinFET 技术实现,TeraPool 实现了典型的近 GHz 频率(910MHz),0.80 V/25C。能效的层次化 PE 到 L1 存储互联仅消耗 9-13.5pJ 用于存储银行访问,仅为 FP32 FMA 成本的 0.74-1.1 倍。设计了高带宽主存链接以管理 L1 存储内外的数据传输,能够维持 HBM2E 主存的完整带宽。在 910MHz 下,该集群在基准内实现最高 1.89 个单精度 TFLOP/s 峰值性能和 200GFLOP/s/W 能效(在平均每个 PE 的高 IPC/0.8)的基准内,展示了将共享 L1 集群规模化至千个 PE 的可行性,这是文献中报告的最大集群数量的四倍。
引用
@article{arxiv.2603.01629,
title = {TeraPool: A Physical Design Aware, 1024 RISC-V Cores Shared-L1-Memory Scaled-up Cluster Design with High Bandwidth Main Memory Link},
author = {Yichao Zhang and Marco Bertuletti and Chi Zhang and Samuel Riedel and Diyou Shen and Bowen Wang and Alessandro Vanelli-Coralli and Luca Benini},
journal= {arXiv preprint arXiv:2603.01629},
year = {2026}
}
备注
14 Pages, 14 Figures, 6 Tables. Published in: IEEE Transactions on Computers ( Volume: 74, Issue: 11, November 2025)