中文

基于变分信息瓶颈的序列网络压缩方法用于人体动作识别

计算机视觉与模式识别 2020-11-10 v2 信息论 机器学习 math.IT

摘要

在过去几年中,深度神经网络的压缩已成为机器学习和计算机视觉研究的一个重要方向。当深度模型被用于例如从视频中进行人体动作识别(HAR)时,需要可观的计算复杂度和存储空间,使其不适合部署在边缘设备上。在本文中,我们针对此问题提出了一种有效压缩用于 HAR 的循环神经网络(RNNs,如门控循环单元(GRUs)和长短期记忆单元(LSTMs))的方法。我们采用基于变分信息瓶颈(VIB)理论的剪枝方法,将 RNN 序列单元中的信息流限制在一个小的子集内。此外,我们将剪枝方法与一种特定的 group-lasso 正则化技术相结合,显著提升了压缩效果。所提出的技术从隐表示中减少了模型参数和内存占用,在验证精度几乎不降低或无降低的情况下,将推理速度提高了数倍。我们在三个广泛使用的动作识别数据集(即 UCF11、HMDB51 和 UCF101)上进行实验以验证我们的方法。结果表明,在 UCF11 的动作识别任务上,我们的方法以相当的精度实现了比最接近的竞争对手高逾 70 倍的压缩率。

关键词

引用

@article{arxiv.2010.01343,
  title  = {A Variational Information Bottleneck Based Method to Compress Sequential Networks for Human Action Recognition},
  author = {Ayush Srivastava and Oshin Dutta and Prathosh AP and Sumeet Agarwal and Jigyasa Gupta},
  journal= {arXiv preprint arXiv:2010.01343},
  year   = {2020}
}

备注

Accepted at IEEE WACV 2021