中文

基于深度学习的视觉手势识别: 方法、数据集、挑战与未来研究方向的综合回顾

计算机视觉与模式识别 2026-05-12 v4

摘要

深度学习(DL)模型的快速发展和可用数据集的不断增大,使研究社区对始终重要的视觉手势识别(VHGR)领域产生了浓厚兴趣,并为诸如符号语言理解和人机交互等各种应用提供了广泛前景。尽管该领域已有大量研究工作,但仍缺乏对VHGR的结构化和完整的调查,导致研究人员不得不浏览数百篇论文才能了解当前的最先进技术(SOTA)。当前调查旨在填补这一空白,通过呈现这一计算机视觉领域的全面概述来实现这一目标。本综述采用系统的研究方法和结构化的呈现方式,呈现各种方法、数据集和评估指标,旨在为研究人员提供有用的指南,帮助他们提出改进。具体而言,本次调查聚焦于四个基本问题:视觉手势识别的主要方面是什么,当前的SOTA方法是什么,不同方法和任务之间可以提炼出什么比较性洞见,以及哪些挑战塑造了未来的研究方向。本次调查从用于查找相关文献的方法开始,以基于分类的格式识别和组织关键VHGR方法。将SOTA方法跨三个主要VHGR任务进行分组:静态手势、孤立动态手势和连续手势识别。对于每个任务,列出了架构趋势和学习策略。为支持该领域未来方法的实验评估,本研究回顾了常用的数据集并呈现了标准性能指标。我们的调查通过确定VHGR中的主要挑战(包括通用计算机视觉问题和特定于领域的障碍),并概述了未来研究的有前景的方向,作了结论。

关键词

引用

@article{arxiv.2507.04465,
  title  = {Visual Hand Gesture Recognition with Deep Learning: A Comprehensive Review of Methods, Datasets, Challenges and Future Research Directions},
  author = {Konstantinos Foteinos and Manousos Linardakis and Panagiotis Radoglou-Grammatikis and Vasileios Argyriou and Panagiotis Sarigiannidis and Iraklis Varlamis and Georgios Th. Papadopoulos},
  journal= {arXiv preprint arXiv:2507.04465},
  year   = {2026}
}

备注

Submitted to Neurocomputing. Rewritten abstract, due to limited space