中文

用于静态图像动作识别的深度神经网络集成方法

计算机视觉与模式识别 2020-03-24 v1

摘要

尽管近年来在特征提取与分类领域取得了显著进展,人体动作识别仍然具有挑战性,尤其在图像中——与视频不同,图像中没有运动信息。因此,为视频中人体动作识别提出的方法无法应用于静态图像。静态图像动作识别的一大挑战是缺乏足够大规模的数据集,这对于训练深度卷积神经网络(CNN)而言因过拟合问题而尤为棘手。本文利用预训练 CNN,采用迁移学习技术来应对大规模标注动作识别数据集的匮乏。此外,由于 CNN 的最后一层包含类别特定信息,我们对 CNN 的输出特征图施加注意力机制,以提取更具判别力且更强大的特征用于人体动作分类。进而,我们在框架中使用了八种不同的预训练 CNN,并考察它们在 Stanford 40 数据集上的性能。最后,我们提出使用集成学习(Ensemble Learning)技术,通过结合多个模型的预测来提升动作分类的整体准确率。我们方法的最佳设置能够在 Stanford 40 数据集上达到 93.17% 的准确率。

关键词

引用

@article{arxiv.2003.09893,
  title  = {Ensembles of Deep Neural Networks for Action Recognition in Still Images},
  author = {Sina Mohammadi and Sina Ghofrani Majelan and Shahriar B. Shokouhi},
  journal= {arXiv preprint arXiv:2003.09893},
  year   = {2020}
}

备注

5 pages, 2 figures, 3 tables, Accepted by ICCKE 2019