实时手势识别:基于骨架数据融合与多流CNN的集成方法
计算机视觉与模式识别
2026-04-17 v2 人机交互
摘要
手势识别(HGR)能够在各种现实世界场景中实现直观的人机交互。然而,现有框架往往难以满足实际HGR应用对实时性的关键要求。本研究提出了一种鲁棒的、基于骨架的动态手势识别框架,该框架将动态手势识别简化为静态图像分类任务,有效降低了硬件和计算需求。我们的框架利用数据级融合技术,将动态手势的3D骨架数据编码为静态RGB时空图像。它集成了专门的端到端集成调谐器(e2eET)多流CNN架构,在最小化计算需求的同时优化了数据表示之间的语义连接。在五个基准数据集(SHREC'17、DHG-14/28、FPHA、LMDHG和CNR)上的测试表明,该框架的性能与最先进方法相当。通过在标准消费级PC硬件上的部署,也证明了其支持实时HGR应用的能力,在现实环境中展示了低延迟和极低的资源占用。该框架的成功部署凸显了其在虚拟/增强现实、环境智能和辅助技术等领域增强实时应用的潜力,为动态手势识别提供了一种可扩展且高效的解决方案。
引用
@article{arxiv.2406.15003,
title = {Real-Time Hand Gesture Recognition: Integrating Skeleton-Based Data Fusion and Multi-Stream CNN},
author = {Oluwaleke Yusuf and Maki Habib and Mohamed Moustafa},
journal= {arXiv preprint arXiv:2406.15003},
year = {2026}
}
备注
14 pages. 7 figures. Code available at https://github.com/Outsiders17711/e2eET-Skeleton-Based-HGR-Using-Data-Level-Fusion