一种具有时间编码与深度压缩的实时动作表示
计算机视觉与模式识别
2020-06-18 v1
摘要
深度神经网络在基于视频的动作识别中取得了显著成功。然而,由于计算成本高,大多数现有方法无法实际部署。为应对这一挑战,我们提出了一种称为时间卷积三维网络(T-C3D)的新型实时卷积架构,用于动作表示。T-C3D 以分层多粒度方式学习视频动作表示,同时获得高处理速度。具体而言,我们提出一种残差三维卷积神经网络(CNN)来捕获单帧外观与连续帧间运动的互补信息。基于此 CNN,我们开发了一种新的时间编码方法来探索整个视频的时间动态。此外,我们将深度压缩技术与 T-C3D 集成,通过减小模型尺寸进一步加速模型部署。通过这些手段,推理时可避免大量计算,使方法能以超越实时的速度处理视频,同时保持良好性能。我们的方法在 UCF101 动作识别基准上相较当前最优实时方法准确率提升 5.4%,推理速度加快 2 倍,且模型存储小于 5MB。我们通过在四个不同基准、三个不同任务上研究其动作表示性能来验证我们的方法。大量实验证明了与最优方法相当识别性能。源代码与预训练模型公开于 https://github.com/tc3d。
引用
@article{arxiv.2006.09675,
title = {A Real-time Action Representation with Temporal Encoding and Deep Compression},
author = {Kun Liu and Wu Liu and Huadong Ma and Mingkui Tan and Chuang Gan},
journal= {arXiv preprint arXiv:2006.09675},
year = {2020}
}