BILLNET:面向硬件高效视频推理的二叉 Conv3D-LSTM 网络
计算机视觉与模式识别
2025-01-27 v1 硬件体系结构
摘要
长短期记忆(LSTM)和 3D 卷积(Conv3D)在许多基于视频的应用中表现突出,但需要大量内存和计算资源。鼓舞人心地,近期关于面向高效推断的硬件-算法协同设计的最新工作推动了我们提出一种紧凑的二叉 Conv3D-LSTM 模型 architecture,适用于高度受限的硬件环境。首先,BILLNET 提出将昂贵的标准 Conv3D 分解为两个点卷积(pointwise convolution),其中间包含一个分组卷积(grouped convolution)。其次,BILLNET 通过一种 MUX-OR-gated 残差 architecture 启用了二叉权重和激活函数。最后,为了高效训练 BILLNET,我们提出了一种多阶段训练 strategy,使 LSTM 层完全量化。在 Jester 数据集上,我们的方法在已有 Conv3D 资源高效模型的计算预算和内存预算方面均取得了高准确率。
引用
@article{arxiv.2501.14495,
title = {BILLNET: A Binarized Conv3D-LSTM Network with Logic-gated residual architecture for hardware-efficient video inference},
author = {Van Thien Nguyen and William Guicquero and Gilles Sicard},
journal= {arXiv preprint arXiv:2501.14495},
year = {2025}
}
备注
Published at IEEE SiPS 2022