中文

Res3ATN——用于视频中手势识别的深度三维残差注意力网络

计算机视觉与模式识别 2020-01-07 v1 机器学习 图像与视频处理 信号处理

摘要

手势识别在视频中是一项艰巨的任务。本文中,我们使用一个端到端训练的三维残差注意力网络进行手势识别。基于堆叠的多个注意力模块,我们构建了一个在每一注意力模块处生成不同特征的三维网络。我们基于三维注意力的残差网络(Res3ATN)可构建并扩展至极深层。利用该网络,基于三个公开可用数据集对其他三维网络进行了广泛分析。将 Res3ATN 网络性能与 C3D、ResNet-10 及 ResNext-101 网络进行比较。我们还研究并评估了具有不同注意力模块数量的基线网络。比较表明,具有 3 个注意力模块的三维残差注意力网络在注意力学习中具有鲁棒性,并能够以更高准确率对手势进行分类,从而优于现有网络。

关键词

引用

@article{arxiv.2001.01083,
  title  = {Res3ATN -- Deep 3D Residual Attention Network for Hand Gesture Recognition in Videos},
  author = {Naina Dhingra and Andreas Kunz},
  journal= {arXiv preprint arXiv:2001.01083},
  year   = {2020}
}

备注

10 pages, 4 figures, International Conference on 3D Vision (3DV 2019), Quebec City, Canada, September 16-19, 2019