中文

基础模型与基于骨架的方法在人机交互手势识别中的比较

计算机视觉与模式识别 2025-06-27 v1 人机交互 机器人学

摘要

手势使得非语言的人机通信成为可能,尤其是在敏捷生产等嘈杂环境中。传统的基于深度学习的手势识别依赖于使用图像、视频或骨骼姿态估计作为输入的任务特定架构。与此同时,具有强大泛化能力的视觉基础模型(VFM)和视觉语言模型(VLM)提供了通过替换专用任务特定模块来降低系统复杂性的潜力。本研究探讨了将这些模型应用于动态全身手势识别的适应性,比较了V-JEPA(一种最先进的VFM)、Gemini Flash 2.0(一种多模态VLM)和HD-GCN(一种性能最佳的基于骨架的方法)。我们引入了NUGGET,一个为内部物流环境中的人机通信量身定制的数据集,以评估不同的手势识别方法。在我们的实验中,HD-GCN取得了最佳性能,但V-JEPA通过一个简单的任务特定分类头也接近其性能——从而为通过将其用作共享多任务模型来降低系统复杂性铺平了道路。相比之下,Gemini在零样本设置中仅基于文本描述难以区分手势,这凸显了对手势合适输入表示进行进一步研究的必要性。

关键词

引用

@article{arxiv.2506.20795,
  title  = {How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?},
  author = {Stephanie Käs and Anton Burenko and Louis Markert and Onur Alp Culha and Dennis Mack and Timm Linder and Bastian Leibe},
  journal= {arXiv preprint arXiv:2506.20795},
  year   = {2025}
}