GestFormer:用于动态手势识别的多尺度小波池化变换网络
计算机视觉与模式识别
2024-05-21 v1 人机交互
摘要
变换器模型在诸多应用(如自然语言处理、分类等)中取得了最先进的成绩,但在手势识别任务中的探索仍有限。因此,我们提出了一种 novel GestFormer 架构用于动态手势识别。该设计动机是构建资源高效的变换器模型,因为变换器计算昂贵且复杂。我们提出使用基于池化的 token 混合器 PoolFormer,因为其仅使用池化层(非参数层)而非二次注意力。该模型还利用小波变换的空间不变特征,并通过多尺度池化选择多尺度特征。进一步,一个门控机制有助于在上下文信息的帮助下聚焦于手势的细节。这显著提高了该模型的性能,相较于传统变换器在动态手势数据集(包括 NVIDIA Dynamic Hand Gesture 和 Briareo 数据集)上使用更少参数。为证明该模型的有效性,我们在单输入和多模态输入(如红外、法线、深度、光流和彩色图像)上进行了实验。我们还就资源效率和运算数量对比了 GestFormer。该模型的源代码可在 https://github.com/mallikagarg/GestFormer 获取。
关键词
引用
@article{arxiv.2405.11180,
title = {GestFormer: Multiscale Wavelet Pooling Transformer Network for Dynamic Hand Gesture Recognition},
author = {Mallika Garg and Debashis Ghosh and Pyari Mohan Pradhan},
journal= {arXiv preprint arXiv:2405.11180},
year = {2024}
}