中文

面向通用GPU指令集架构:并行处理器中硬件不变计算原语的跨厂商分析

分布式、并行与集群计算 2026-04-01 v1 硬件体系结构

摘要

我们首次对GPU指令集架构进行了系统性的跨厂商分析,涵盖全部四大GPU厂商:NVIDIA(PTX ISA v1.0至v9.2,Fermi至Blackwell)、AMD(RDNA 1至4和CDNA 1至4)、Intel(Gen11,Xe-LP,Xe-HPG,Xe-HPC)和Apple(G13,反向工程)。基于官方ISA参考手册、架构白皮书、专利申请以及社区反向工程努力,总计超过5000页的一手来源,涵盖16种不同微架构,我们识别出出现在全部四种架构中的十种硬件不变计算原语、六种参数化方言(厂商以不同参数实现相同概念)以及六种真正架构分歧,代表根本设计分歧。基于此分析,我们提出了一种面向厂商中立GPU ISA的抽象执行模型,该模型基于并行计算的物理约束。我们使用NVIDIA T4和Apple M1硬件验证了该模型,它们是我们研究中架构差异最大的两个平台。在六个基准-平台对中的五个上,抽象模型匹配或超越了原生厂商优化性能。唯一的异常(NVIDIA上的并行归约,为原生性能的62.5%)揭示波内洗牌必须是必选原语,这一发现完善了我们提出的模型。

关键词

引用

@article{arxiv.2603.28793,
  title  = {Toward a Universal GPU Instruction Set Architecture: A Cross-Vendor Analysis of Hardware-Invariant Computational Primitives in Parallel Processors},
  author = {Ojima Abraham and Onyinye Okoli},
  journal= {arXiv preprint arXiv:2603.28793},
  year   = {2026}
}

备注

7 pages, 3 figures, 5 tables, 26 references