中文

PolyLUT:基于硬件感知结构剪枝的低延迟多项式推理

机器学习 2025-01-15 v1 硬件体系结构

摘要

标准深度神经网络推理涉及交错的线性映射和非线性激活函数的计算。先前的工作为实现超低延迟将这些操作硬编码到 FPGA 查找表 (LUT) 中。然而,FPGA LUT 可以实现更广泛的函数 variety。在本文中,我们提出了一种新方法,用于训练面向 FPGA 部署的 DNN。我们将多元多项式作为基本构建块。该方法利用软逻辑提供的灵活性,将多项式求值隐藏在 LUT 中,开销最小。通过使用多项式构建块,我们在显著减少软逻辑层数的情况下实现了相同精度,从而实现了显著的延迟和面积改进。LUT 基于实现也面临着 LUT 大小随输入数量指数增长的重大挑战。先前工作依赖固定稀疏性,结果严重依赖于随机种子选择。为此,我们提出了一种结构化剪枝策略,采用定制硬件感知分组正则化器,以鼓励特定稀疏模式,从而导致每个神经元的输入数量较少。我们在三个任务上展示了 PolyLUT 的有效性:网络入侵检测、CERN 大型强子对撞机的喷流识别以及 MNIST。

关键词

引用

@article{arxiv.2501.08043,
  title  = {PolyLUT: Ultra-low Latency Polynomial Inference with Hardware-Aware Structured Pruning},
  author = {Marta Andronic and Jiawen Li and George A. Constantinides},
  journal= {arXiv preprint arXiv:2501.08043},
  year   = {2025}
}

备注

arXiv admin note: text overlap with arXiv:2309.02334