中文

不容浪费:将时间压缩至通道以实现移动端视频理解

计算机视觉与模式识别 2024-05-15 v1

摘要

当前的视频理解架构主要建立在 3D 卷积块或带有用于时间建模的附加操作的 2D 卷积之上。然而,这些方法都将时间轴视为视频序列的独立维度,这需要大量的计算和内存开销,从而限制了它们在移动设备上的使用。在本文中,我们提出将视频序列的时间轴压缩至通道维度,并提出一种用于移动端视频理解的轻量级视频识别网络,称为 \textit{SqueezeTime}。为了增强所提出网络的时间建模能力,我们设计了一个 Channel-Time Learning (CTL) 块来捕捉序列的时间动态。该模块具有两个互补分支,其中一个分支用于时间重要性学习,另一个具有时间位置恢复能力的分支用于增强跨时间目标建模能力。所提出的 SqueezeTime 非常轻量且快速,在移动端视频理解方面具有很高的准确率。在各种视频识别和动作检测基准(即 Kinetics400、Kinetics600、HMDB51、AVA2.1 和 THUMOS14)上的大量实验证明了我们模型的优越性。例如,与先前的方法相比,我们的 SqueezeTime 在 Kinetics400 上实现了 +1.2%+1.2\% 的准确率和 +80%+80\% 的 GPU 吞吐量提升。代码已在 https://github.com/xinghaochen/SqueezeTime 和 https://github.com/mindspore-lab/models/tree/master/research/huawei-noah/SqueezeTime 上公开。

关键词

引用

@article{arxiv.2405.08344,
  title  = {No Time to Waste: Squeeze Time into Channel for Mobile Video Understanding},
  author = {Yingjie Zhai and Wenshuo Li and Yehui Tang and Xinghao Chen and Yunhe Wang},
  journal= {arXiv preprint arXiv:2405.08344},
  year   = {2024}
}