中文

基于多尺度多头注意力的视频 Transformer 网络用于手势识别

计算机视觉与模式识别 2025-01-03 v1 人机交互

摘要

由于打手势者的手部姿态、大小和形状的变化,动态手势识别是具有挑战性的研究领域之一。本文提出了一种用于动态手势识别的多尺度多头注意力视频 Transformer 网络(MsMHA-VTN)。使用 Transformer 多尺度头注意力模型提取多尺度特征的金字塔层次结构。所提出的模型在 Transformer 的每个头中采用不同的注意力维度,使其能够在多尺度级别提供注意力。此外,除了单一模态外,还检验了使用多模态的识别性能。大量实验表明,所提出的 MsMHA-VTN 性能优越,在 NVGesture 和 Briareo 数据集上的总体准确率分别达到 88.22% 和 99.10%。

关键词

引用

@article{arxiv.2501.00935,
  title  = {Multiscaled Multi-Head Attention-based Video Transformer Network for Hand Gesture Recognition},
  author = {Mallika Garg and Debashis Ghosh and Pyari Mohan Pradhan},
  journal= {arXiv preprint arXiv:2501.00935},
  year   = {2025}
}