中文

CUTEv2:面向多样 CPU 架构的统一可配置矩阵扩展方案及其低设计开销

硬件体系结构 2026-04-14 v1 人工智能 分布式、并行与集群计算 机器学习

摘要

矩阵扩展已成为现代 CPU 中的关键特性,旨�应对 AI 工作负载的日益增长需求。然而,现有设计常因硬件和软件设计开销的显著增加而受限。与 CPU 流水线的紧密耦合使其在跨越多样 CPU 平台时集成复杂,而细粒度同步指令则阻碍高性能内核的开发。本文提出一种统一可配置的 CPU 矩阵扩展架构。通过将矩阵单元从 CPU 流水线中解耦,设计实现低开销集成,同时保持与既有计算和存储资源的紧密协调。可配置的矩阵单元支持混合精度运算,适应多样的计算需求和存储带宽限制。一种具备灵活粒度的异步矩阵乘法抽象隐藏硬件细节,简化矩阵向量重叠操作,并支持统一的软件堆栈。该架构被集成到四个开源 CPU RTL 平台上,并在代表性 AI 模型上进行评估。在 GEMM 工作负载下,矩阵单元利用率在所有平台上均超过 90%。当配置为相当于 Intel AMX 的计算吞吐和存储带宽时,我们的设计在 ResNet、BERT 和 Llama3 上的加速分别为 1.57 倍、1.57 倍和 2.31 倍,其中超过 30% 的提升归功于重叠的矩阵向量执行。4 TOPS@2GHz 的矩阵单元仅占用 14nm CMOS 中的 0.53 mm²。这些结果表明该方案在跨平台适应性和硬件软件协同优化方面具有强大的效果,为开源社区提供了实用的矩阵扩展方案。

关键词

引用

@article{arxiv.2604.11615,
  title  = {CUTEv2: Unified and Configurable Matrix Extension for Diverse CPU Architectures with Minimal Design Overhead},
  author = {Jinpeng Ye and Chongxi Wang and Wenqing Li and Bin Yuan and Shiyi Wang and Fenglu Zhang and Junyu Yue and Jianan Xie and Yunhao Ye and Haoyu Deng and Yingkun Zhou and Xin Cheng and Fuxin Zhang and Jian Wang},
  journal= {arXiv preprint arXiv:2604.11615},
  year   = {2026}
}

备注

Accepted to DAC 2026