中文

NeuraLUT-Assemble:面向 FPGA 高效 LUT 推理的硬件感知子神经网络组装

机器学习 2025-04-02 v1

摘要

利用查找表 (LUT) 实现的高效神经网络 (NN) 已在新兴 AI 应用中展现出显著潜力,尤其在面向现场可编程门阵列 (FPGA) 的边缘计算部署时。这些架构承诺实现超低延迟和降低资源消耗,拓展了神经网络在粒子物理等领域的应用。然而,现有基于 LUT 的设计因神经元所需的大规模 fan-in 受限于 LUT 资源随输入宽度指数级增长,导致精度下降。实际应用中, prior work 已通过依赖极稀疏模型来缓解这一矛盾。我们提出 NeuraLUT-Assemble,一种新型框架,通过结合混合精度技术与更大神经网络单元的组装,既提升了连通性,又保持了各 LUT 输入数量在可控范围内。此外,我们引入跨整个 LUT 结构的 skip-connection 以改善梯度流动。NeuraLUT-Assemble 缩小了基于 LUT 的方法与 fully-connected MLP 模型之间的精度差距,在网络入侵检测、手写数字识别和喷气机分类等任务上实现了与 state-of-the-art 相当的精度,相较于当时最先进的做法实现了最高 8.42×8.42\times 的面积-延迟乘积降低。

关键词

引用

@article{arxiv.2504.00592,
  title  = {NeuraLUT-Assemble: Hardware-aware Assembling of Sub-Neural Networks for Efficient LUT Inference},
  author = {Marta Andronic and George A. Constantinides},
  journal= {arXiv preprint arXiv:2504.00592},
  year   = {2025}
}