深度视频动作识别骨干网络综述
计算机视觉与模式识别
2024-05-10 v1 人工智能
摘要
动作识别是构建交互式元宇宙的关键技术。随着深度学习的快速发展,动作识别方法也取得了巨大进展。研究人员从多个视角出发设计并实现骨干网络,这导致了方法的多样性,同时也面临新的挑战。本文回顾了几种基于深度神经网络的动作识别方法。我们从三个部分介绍这些方法:1)双流网络及其变体,具体而言,在本文中它们使用 RGB 视频帧和光流模态作为输入;2)3D 卷积网络,致力于直接利用 RGB 模态,而不再需要提取不同的运动信息;3)基于 Transformer 的方法,将自然语言处理中的模型引入计算机视觉与视频理解领域。我们在本综述中提供客观见解,希望能为未来研究提供参考。
引用
@article{arxiv.2405.05584,
title = {A Survey on Backbones for Deep Video Action Recognition},
author = {Zixuan Tang and Youjun Zhao and Yuhang Wen and Mengyuan Liu},
journal= {arXiv preprint arXiv:2405.05584},
year = {2024}
}
备注
This paper has been accepted by ICME workshop