中文

用于动作识别的带注意力机制的3D卷积网络

计算机视觉与模式识别 2022-06-07 v1

摘要

人体动作识别是计算机视觉中具有挑战性的任务之一。当前的动作识别方法使用计算代价高昂的模型来学习动作的时空依赖关系。利用RGB通道与光流分别处理的模型、采用双流融合技术的模型,以及由卷积神经网络(CNN)与长短期记忆(LSTM)网络构成的模型,都是此类复杂模型的例子。此外,微调此类复杂模型同样计算代价高昂。本文提出了一种由3D卷积层、全连接(FC)层和注意力层组成的深度神经网络架构,用于学习此类依赖关系,其更易于实现,并在UCF-101数据集上取得了具有竞争力的性能。所提方法首先通过3D-CNN学习动作的空间与时间特征,随后注意力机制帮助模型将注意力定位到用于识别的关键特征上。

关键词

引用

@article{arxiv.2206.02203,
  title  = {3D Convolutional with Attention for Action Recognition},
  author = {Labina Shrestha and Shikha Dubey and Farrukh Olimov and Muhammad Aasim Rafique and Moongu Jeon},
  journal= {arXiv preprint arXiv:2206.02203},
  year   = {2022}
}