MVTN:用于手势识别的多尺度视频变换网络
计算机视觉与模式识别
2024-12-24 v1 人机交互
摘要
本文提出了一种新型多尺度视频变换网络(MVTN)用于动态手势识别,因为多尺度特征可以提取具有可变大小、姿态和形状的手部特征,这是手势识别中的一个挑战。 proposed 模型包含多尺度特征层次结构,以捕获手势中不同程度的细节和上下文,从而增强模型的能力。这种多尺度层次结构通过在不同变换阶段提取不同维度的注意力获得,其中初始阶段用于建模高分辨率特征,后期阶段用于建模低分辨率特征。我们的做法还利用多模态数据,利用来自 NVGesture 和 Briareo 数据集的深度图、红外数据和表面法向数据,以及 RGB 图像。实验表明,所提出的 MVTN 以更少的计算复杂度和参数数量实现了最先进的成绩。源代码可在 https://github.com/mallikagarg/MVTN 上获得。
引用
@article{arxiv.2409.03890,
title = {MVTN: A Multiscale Video Transformer Network for Hand Gesture Recognition},
author = {Mallika Garg and Debashis Ghosh and Pyari Mohan Pradhan},
journal= {arXiv preprint arXiv:2409.03890},
year = {2024}
}