面向视频识别的基于完全分解 Tucker 层级结构的极紧凑 RNN
计算机视觉与模式识别
2021-04-21 v3 人工智能
摘要
循环神经网络(RNNs)已广泛用于序列分析与建模。然而,在处理高维数据时,RNNs 通常需要非常大的模型规模,从而带来一系列部署挑战。尽管已有多种先前工作被提出以缩减 RNN 模型规模,在资源受限环境中执行 RNN 模型仍是非常具有挑战性的问题。本文中,我们提出开发具有完全分解 Tucker 层级(FDHT)结构的极紧凑 RNN 模型。Tucker 分解不仅比其他张量分解方法提供更高的存储成本缩减,还为紧凑 RNN 模型带来更好的精度性能提升。同时,不同于现有基于张量分解、仅能分解 RNN 输入到隐藏层的方法,我们提出的完全分解方法实现了对整个 RNN 模型的全面压缩,并保持极高精度。我们在多个流行视频识别数据集上的实验结果表明,所提出的基于完全分解 Tucker 的 LSTM(FDHT-LSTM)极为紧凑且高效。据我们所知,FDHT-LSTM 首次在不同数据集上仅以数千参数(3,132 至 8,808)一致地实现非常高精度。相较于最先进的压缩 RNN 模型,如 TT-LSTM、TR-LSTM 与 BT-LSTM,我们的 FDHT-LSTM 同时享有少几个数量级(3,985 至 10,711 倍)的参数与显著的精度提升(0.6% 至 12.7%)。
引用
@article{arxiv.2104.05758,
title = {Towards Extremely Compact RNNs for Video Recognition with Fully Decomposed Hierarchical Tucker Structure},
author = {Miao Yin and Siyu Liao and Xiao-Yang Liu and Xiaodong Wang and Bo Yuan},
journal= {arXiv preprint arXiv:2104.05758},
year = {2021}
}
备注
This paper is a preprint that was accepted in CVPR'21. arXiv admin note: substantial text overlap with arXiv:2005.04366