中文

基于深度学习的多模态深度感知动态手势识别系统

计算机视觉与模式识别 2025-12-23 v2 人机交互 机器学习

摘要

动态手势识别任务已在多种单模态与多模态方法上得到研究。此前,研究者已探索基于深度与2D骨架的多模态融合CRNN(卷积循环神经网络),但在获得预期识别结果方面存在局限。本文重新审视这一手势识别方法并提出若干改进。我们观察到原始深度图像在感兴趣手部区域(ROI)对比度低,未能突出手指朝向、手指与手掌重叠或手指间重叠等重要细节。因此我们提出将深度值量化为若干离散区域,以在手部若干关键部分间产生更高对比度。此外,我们提出若干解决现有多模态融合CRNN架构中高方差问题的方法。我们在两个基准上评估了我们的方法:DHG-14/28数据集与SHREC'17 track数据集。相较先前类似多模态方法,我们的方法在准确率与参数效率上均有显著提升,并取得了与当前最优(state-of-the-art)相当的结果。

关键词

引用

@article{arxiv.2107.02543,
  title  = {A Deep Learning-based Multimodal Depth-Aware Dynamic Hand Gesture Recognition System},
  author = {Hasan Mahmud and Mashrur M. Morshed and Md. Kamrul Hasan},
  journal= {arXiv preprint arXiv:2107.02543},
  year   = {2025}
}