F4D:用于高效视频级表征学习的分解 4D 卷积神经网络
计算机视觉与模式识别
2024-01-18 v1
摘要
最近的研究表明,视频级表征学习对于视频动作识别中长程时间结构的捕捉和理解至关重要。大多数现有的基于 3D 卷积神经网络(CNN)的视频级表征学习方法是基于片段的,仅关注短期运动和外观。这些基于 CNN 的方法缺乏整合和建模底层视频长程时空表征的能力,并在训练期间忽略了长程视频级上下文。在本研究中,我们提出了一种带注意力的分解 4D CNN 架构(F4D),能够学习更有效、更细粒度的长程时空视频表征。我们证明了所提出的 F4D 架构相比文献中提出的传统 2D 和 3D CNN 架构产生了显著的性能提升。在五个动作识别基准数据集(即 Something-Something-v1、Something-Something-v2、Kinetics-400、UCF101 和 HMDB51)上的实验评估证明了所提出的 F4D 网络架构在视频级动作识别上的有效性。
引用
@article{arxiv.2401.08609,
title = {F4D: Factorized 4D Convolutional Neural Network for Efficient Video-level Representation Learning},
author = {Mohammad Al-Saad and Lakshmish Ramaswamy and Suchendra Bhandarkar},
journal= {arXiv preprint arXiv:2401.08609},
year = {2024}
}