中文

Flatten:将视频动作识别转化为图像分类任务

计算机视觉与模式识别 2024-08-20 v1 人工智能

摘要

近年来,视频动作识别作为视频理解领域的一项基础任务,已被众多研究者深入探索。大多数传统视频动作识别方法通常涉及将视频转换为同时封装空间和时间信息的三维数据,随后利用主流的图像理解模型对这些数据进行建模和分析。然而,这些方法存在显著缺陷。首先,在深入研究视频动作识别任务时,图像理解模型通常需要在模型架构和预处理方面针对这些时空任务进行相应调整;其次,与低维数据相比,处理高维数据往往带来更大的挑战和更高的时间成本。为了弥合图像理解与视频理解任务之间的差距,同时简化视频理解的复杂性,我们引入了一种新颖的视频表示架构 Flatten,它作为一个即插即用的模块,可以无缝集成到任何图像理解网络中,以实现高效且有效的三维时序数据建模。具体而言,通过应用特定的展平操作(例如,行主序变换),三维时空数据被转换为二维空间信息,然后使用普通的图像理解模型来捕获时间动态和空间语义信息,从而完成有效且高效的视频动作识别。在常用数据集(Kinetics-400、Something-Something v2 和 HMDB-51)和三种经典图像分类模型(Uniformer、SwinV2 和 ResNet)上进行的大量实验表明,嵌入 Flatten 能显著提升原始模型的性能。

关键词

引用

@article{arxiv.2408.09220,
  title  = {Flatten: Video Action Recognition is an Image Classification task},
  author = {Junlin Chen and Chengcheng Xu and Yangfan Xu and Jian Yang and Jun Li and Zhiping Shi},
  journal= {arXiv preprint arXiv:2408.09220},
  year   = {2024}
}

备注

13pages, 6figures