中文

基于分层 Tucker 张量分解的能效 LSTM 视频识别网络算法与硬件协同设计

计算机视觉与模式识别 2022-12-06 v1

摘要

长短期记忆(LSTM)是一种强大的深度神经网络,已广泛应用于许多序列分析与建模任务。然而,LSTM 网络的大模型尺寸问题使其实际部署仍非常具有挑战性,尤其是对于需要高维输入数据的视频识别任务。为克服该限制并充分释放 LSTM 模型的潜力,本文提出对高性能、高能效的 LSTM 网络进行算法与硬件协同设计。在算法层面,我们提出开发基于全分解分层 Tucker(FDHT)结构的 LSTM,即 FDHT-LSTM,其在享受超低模型复杂度的同时仍能达到高准确率。为充分获取这一引人注目的算法收益,我们进一步开发了相应的定制硬件架构以支持所提 FDHT-LSTM 模型的高效执行。通过精细的存储器访问方案设计,复杂的矩阵变换可由底层硬件以无访问冲突的片上实时方式高效支持。我们的评估结果表明,所提出的超紧凑 FDHT-LSTM 模型及相应硬件加速器均实现了非常高性能。与最先进的压缩 LSTM 模型相比,FDHT-LSTM 在不同视频识别数据集上均实现了模型尺寸的数量级缩减与显著准确率提升。同时,与最先进的张量分解模型导向硬件 TIE 相比,我们所提 FDHT-LSTM 架构在 LSTM-Youtube 负载上分别于吞吐量、面积效率和能效方面取得更优表现。对于 LSTM-UCF 负载,我们的设计也以更高吞吐量、更高能效和可比面积效率优于 TIE。

关键词

引用

@article{arxiv.2212.02046,
  title  = {Algorithm and Hardware Co-Design of Energy-Efficient LSTM Networks for Video Recognition with Hierarchical Tucker Tensor Decomposition},
  author = {Yu Gong and Miao Yin and Lingyi Huang and Chunhua Deng and Yang Sui and Bo Yuan},
  journal= {arXiv preprint arXiv:2212.02046},
  year   = {2022}
}

备注

TC 2022