中文

深度视频动作识别骨干网络综述

计算机视觉与模式识别 2024-05-10 v1 人工智能

摘要

动作识别是构建交互式元宇宙的关键技术。随着深度学习的快速发展,动作识别方法也取得了巨大进展。研究人员从多个视角出发设计并实现骨干网络,这导致了方法的多样性,同时也面临新的挑战。本文回顾了几种基于深度神经网络的动作识别方法。我们从三个部分介绍这些方法:1)双流网络及其变体,具体而言,在本文中它们使用 RGB 视频帧和光流模态作为输入;2)3D 卷积网络,致力于直接利用 RGB 模态,而不再需要提取不同的运动信息;3)基于 Transformer 的方法,将自然语言处理中的模型引入计算机视觉与视频理解领域。我们在本综述中提供客观见解,希望能为未来研究提供参考。

关键词

引用

@article{arxiv.2405.05584,
  title  = {A Survey on Backbones for Deep Video Action Recognition},
  author = {Zixuan Tang and Youjun Zhao and Yuhang Wen and Mengyuan Liu},
  journal= {arXiv preprint arXiv:2405.05584},
  year   = {2024}
}

备注

This paper has been accepted by ICME workshop