中文

面向专用 AI 硬件高效执行的卷积硬件感知重构:基于 NVIDIA Tensor Cores 的案例研究

分布式、并行与集群计算 2026-01-21 v1 人工智能

摘要

卷积神经网络(CNN)是现代 AI 的核心,但其性能往往受限于硬件约束。例如,NVIDIA Tensor Cores 要求输入通道数为 8 的倍数,有时甚至需要为 512 的倍数才能高效执行。用于 CPU 的 oneDNN 框架对 blocked 格式也施加了此类要求。传统方法通过零填充来解决此类对齐问题,但效率低下。在本工作中,我们提出了 CNN 计算的硬件感知重构的第一步,使用重写规则重构底层数学,以在训练后完全满足硬件对齐要求,且无需修改网络权重。尽管我们目前的实现仅针对 Tensor Cores 的单一变换,但该方法具有可推广性,为探索 CPU 和加速器的额外变换奠定了基础。本研究是迈向语义调优的初步步骤,这是一种系统性的、硬件感知的优化策略,旨在实现 CNN 模型在专用 AI 硬件上的高效部署。

关键词

引用

@article{arxiv.2601.11608,
  title  = {Hardware-Aware Reformulation of Convolutions for Efficient Execution on Specialized AI Hardware: A Case Study on NVIDIA Tensor Cores},
  author = {Ganesh Bikshandi},
  journal= {arXiv preprint arXiv:2601.11608},
  year   = {2026}
}