面向 HPC 负载的硬件设计差异识别方法探索
硬件体系结构
2025-09-15 v1
摘要
为科学应用和机器学习中使用的数学内核开发高效的硬件加速器,传统上是一项劳动密集型任务。这些加速器通常需要使用 Verilog 或其他硬件描述语言进行低级编程,并付出大量的手动优化工作。最近,为了缓解这一挑战,出现了 Chisel 和高层次综合等高层次硬件设计工具。然而,与任何编译器一样,生成的一些硬件与专家手工设计相比可能并非最优。理解这些低效之处出现在哪里至关重要,因为它为用户和工具开发者提供了有价值的见解。在本文中,我们提出了一种将数学内核(如傅里叶变换、矩阵乘法和 QR 分解)分层分解为一组通用构建块或基元的方法。然后在不同的编程环境中实现这些基元,并组装出更大的算法。此外,我们采用自动化方法来研究可达到的频率和所需资源。在每个层级进行此类实验将提供设计之间更公平的比较,并为工具开发者和硬件设计者采用更好的实践提供指导。
引用
@article{arxiv.2509.09774,
title = {Towards An Approach to Identify Divergences in Hardware Designs for HPC Workloads},
author = {Doru Thom Popovici and Mario Vega and Angelos Ioannou and Fabien Chaix and Dania Mosuli and Blair Reasoner and Tan Nguyen and Xiaokun Yang and John Shalf},
journal= {arXiv preprint arXiv:2509.09774},
year = {2025}
}
备注
9 pages, 8 figures