将基于脉动阵列的硬件加速器集成到 DNN 算子自动调优框架中
机器学习
2024-06-11 v1 性能
编程语言
摘要
由于缺少为异构片上系统(SoC)结合定制加速器提供的端到端软件工具,将神经网络部署于此类系统是一项具有挑战性的任务。此外,加速器开发者为典型张量运算所提供的底层调度与映射策略未必对每个特定用例都是最优的。这正是那些能自动在 specific 硬件配置上测试生成代码性能的框架备受关注的原因。本文展示了代码生成框架 TVM 与基于脉动阵列的加速器 Gemmini 之间的集成。详述了将通用矩阵乘(GEneral Matrix Multiply,GEMM)张量运算卸载至 Gemmini 的通用调度,并通过在其上执行 AutoTVM 调优过程检验其适用性。我们的生成代码在 Xilinx ZCU102 FPGA 上以 100 MHz 时钟实现 46 千兆操作每秒(GOPs)的峰值吞吐,优于以往工作。此外,该集成生成的代码在真实工作负载中能够超越 Gemmini 开发者提供的默认手工调优调度。
引用
@article{arxiv.2212.03034,
title = {Integration of a systolic array based hardware accelerator into a DNN operator auto-tuning framework},
author = {F. N. Peccia and O. Bringmann},
journal= {arXiv preprint arXiv:2212.03034},
year = {2024}
}
备注
6 pages, 5 figures, submitted to the CODAI Workshop at the 2022 ESWEEK