ConvMixFormer:面向基于Transformer的动态手势识别的资源高效卷积混合器
计算机视觉与模式识别
2024-12-24 v3 人机交互
机器学习
摘要
Transformer模型在诸多领域如自然语言处理(NLP)和计算机视觉中展现出显著成功。随着对基于Transformer架构的兴趣增长,这些模型也被用于手势识别。因此,我们也探索并构思了一种新的ConvMixFormer架构用于动态手势。Transformer使用注意力特征的二次序列扩展,导致这些模型计算复杂且资源占用大。我们考虑了Transformer的这一缺点,设计了一种资源高效的模型,将Transformer中的自注意力替换为基于简单卷积层的token混合器。卷积混合器的计算成本和参数远小于二次自注意力。卷积混合器帮助模型捕获自注意力因其顺序处理本质而难以捕获的局部空间特征。进一步,采用高效门控机制取代Transformer中常规的前馈网络,以帮助模型控制不同阶段中特征的流动。该设计使用更少的可学习参数,几乎是原始Transformer的一半,从而实现快速高效的训练。我们的方法在NVidia动态手势数据集和Briareo数据集上进行评估,我们的模型在单输入和多模态输入上均取得了最先进的结果。我们还展示了ConvMixFormer模型相对于其他方法的参数效率。源代码可在https://github.com/mallikagarg/ConvMixFormer获取。
引用
@article{arxiv.2411.07118,
title = {ConvMixFormer- A Resource-efficient Convolution Mixer for Transformer-based Dynamic Hand Gesture Recognition},
author = {Mallika Garg and Debashis Ghosh and Pyari Mohan Pradhan},
journal= {arXiv preprint arXiv:2411.07118},
year = {2024}
}