竞速空闲:异构 CPU 和 GPU 架构上的矩阵乘法能效
分布式、并行与集群计算
2025-07-30 v1 计算复杂性
摘要
随着单核处理器功率和热限制的根本性变化,多核和异构计算 paradigm 已确立能效作为高性能计算(HPC)中的首要设计约束。集成传统多核 CPU 与专业加速器(如离散(dGPU)和集成(iGPU)图形处理单元)的异构系统,为在性能与功耗之间寻求权衡提供了有力的路径。然而,对在广泛可获得硬件上的这些权衡进行量化仍然是关键研究领域。本文对 4096x4096 矩阵-矩阵乘法这一典型 HPC 工作负载,在单台消费级笔记本电脑上的三种不同计算架构(AMD Ryzen 7 5800H 多核 CPU、NVIDIA GeForce GTX 1650 离散 GPU、AMD Radeon Vega 集成 GPU)进行直接、经验性测量。使用 Linux perf 和 nvidia-smi 等标准、经过验证且干扰最小的工具,我们发现离散 GPU 不仅是性能领先者,实现了对 CPU 的 93.5 倍加速,还是最具能效的方案,仅耗费 CPU 能耗的 2%,在能效方面实现了 50 倍的提升。这些发现为“竞速空闲”原则提供了实际演示,并为能感知软件开发提供清晰、定量的架构选择指导。
引用
@article{arxiv.2507.20063,
title = {Racing to Idle: Energy Efficiency of Matrix Multiplication on Heterogeneous CPU and GPU Architectures},
author = {Mufakir Qamar Ansari and Mudabir Qamar Ansari},
journal= {arXiv preprint arXiv:2507.20063},
year = {2025}
}
备注
16 pages, 6 figures, 3 listings. A comprehensive empirical study on a consumer-grade heterogeneous platform