基于 ConViT 的静态图像人体动作识别
计算机视觉与模式识别
2024-01-12 v3
摘要
理解图像不同部分之间的关系在诸多应用中至关重要,包括物体识别、场景理解与图像分类。尽管卷积神经网络(CNNs)在物体分类与检测中取得了令人印象深刻的成果,但它们缺乏提取图像不同部分之间关系的能力,而这是人体动作识别(HAR)中的关键因素。为解决该问题,本文提出一种如卷积层般工作并使用 Vision Transformer (ViT) 的新模块。在所提模型中,Vision Transformer 可通过帮助卷积神经网络有效提取图像各部分的关联,在多种任务中对其进行补充。研究表明,与简单 CNN 相比,所提模型能提取图像中有意义的部分并抑制具误导性的部分。所提模型在 Stanford40 与 PASCAL VOC 2012 动作数据集上进行了评估,分别取得了 95.5% 平均精度均值(mAP)与 91.5% mAP 的结果,相较于其他最先进方法颇具前景。
引用
@article{arxiv.2307.08994,
title = {Human Action Recognition in Still Images Using ConViT},
author = {Seyed Rohollah Hosseyni and Sanaz Seyedin and Hasan Taheri},
journal= {arXiv preprint arXiv:2307.08994},
year = {2024}
}