中文

TensorPool: 一种面向 AI 原生无线接入网络的 3D 堆叠 8.4TFLOPS/4.3W 多核专用处理器

硬件体系结构 2026-04-03 v1

摘要

即将在 6G 无线接入网络(RAN)物理层(PHY)集成 AI,将在具有挑战性的传输场景中实现更高的服务质量。然而,经过深度优化的 AI 原生 PHY 模型相比传统基带具有更高的计算复杂度,在现代 PHY 典型的亚毫秒实时约束下部署面临挑战。此外,随着向太赫兹载波的扩展,6G 基站密度的进一步提升进一步限制了基站的功耗,将可用计算预算限制在 \leq 100W。通过多核可编程基带处理器的领域专业化,可以获得所需的灵活性以确保长期可持续性,以及在主导 AI 原生 PHY 的高吞吐量张量计算上实现必要的能效提升。遵循领域专业化策略,我们提出了 TensorPool,这是一个由 256 个 RISCV32IMAF 可编程核心组成的集群,由 16 个 256 MACs/cycle(FP16)张量引擎加速,可低延迟访问 4MiB 的 L1 scratchpad 以实现最大数据复用。在 TSMC 的 N7 工艺中实现,TensorPool 在 AI-RAN 的张量操作上达到 3643 MACs/cycle(89% 张量单元利用率),比无张量加速的纯核心集群多 6 倍,同时将 GOPS/W/mm2^2 效率提升 9.1 倍。此外,我们证明将 TensorPool 的计算模块进行 3D 堆叠以更好地展开张量引擎到 L1 内存的路由,相比 2D 实现可提供 2.32×\times 面积改善且无频率退化。

关键词

引用

@article{arxiv.2604.02291,
  title  = {TensorPool: A 3D-Stacked 8.4TFLOPS/4.3W Many-Core Domain-Specific Processor for AI-Native Radio Access Networks},
  author = {Marco Bertuletti and Yichao Zhang and Diyou Shen and Alessandro Vanelli-Coralli and Frank K. Gürkaynak and Luca Benini},
  journal= {arXiv preprint arXiv:2604.02291},
  year   = {2026}
}

备注

12 pages, 16 figures