基于深度学习的手势识别系统与人机界面设计
计算机视觉与模式识别
2023-01-18 v3 人机交互
摘要
本文提出了一种基于实时手势识别系统的人机交互界面(HCI)。该系统包含六个阶段:(1)手部检测,(2)手势分割,(3)使用五个预训练的卷积神经网络模型(CNN)和视觉Transformer(ViT),(4)构建交互式人机界面(HMI),(5)开发手势控制的虚拟鼠标,(6)使用卡尔曼滤波器估计手部位置,并以此改善指针运动的平滑度。在我们的工作中,采用了五个预训练的CNN模型(VGG16、VGG19、ResNet50、ResNet101和Inception-V1)以及ViT对手势图像进行分类。使用两个多类数据集(一个公开数据集和一个自定义数据集)验证了模型。考虑到模型的性能,观察到Inception-V1在准确率、精确率、召回率和F-score值方面,明显优于其他四个CNN模型和ViT。我们还将此系统扩展,通过不同的自定义手势命令,在实时场景中控制一些桌面应用程序(如VLC播放器、音频播放器、文件管理、玩2D超级马里奥兄弟游戏等)。该系统的平均速度达到25 fps(每秒帧数),满足实时场景的要求。所提出的手势控制系统性能达到了每个控制动作毫秒级的平均响应时间,使其适用于实时应用。该模型(原型)将惠及与桌面交互的肢体残障人士。
引用
@article{arxiv.2207.03112,
title = {Deep learning based Hand gesture recognition system and design of a Human-Machine Interface},
author = {Abir Sen and Tapas Kumar Mishra and Ratnakar Dash},
journal= {arXiv preprint arXiv:2207.03112},
year = {2023}
}