中文

SegSLR:用于孤立手语识别的提示式视频分割

计算机视觉与模式识别 2025-09-16 v1

摘要

孤立手语识别(ISLR)方法主要依赖RGB数据或手势姿态信息。然而,这些模态的组合常因不精确的表示(如边界框)而丢失关键细节,包括手部形状和姿态。因此,我们提出了结合RGB和姿态信息的ISLR系统SegSLR,通过提示式零样视频分割实现。给定手部和签字者身体的粗略定位,我们对相应部位进行视频分割以保留所有相关形状信息。随后,这些分割结果聚焦于RGB数据的处理,仅针对ISLR最相关的身体部位。这种方法有效地融合了RGB和姿态信息。我们在复杂数据集ChaLearn249 IsoGD上进行评估,表明SegSLR在状态-of-the-art方法上均显著优于。此外,消融研究表明,SegSLR在聚焦签字者的身体和手部时效果尤为突出,印证了我们的设计选择。

关键词

引用

@article{arxiv.2509.10710,
  title  = {SegSLR: Promptable Video Segmentation for Isolated Sign Language Recognition},
  author = {Sven Schreiber and Noha Sarhan and Simone Frintrop and Christian Wilms},
  journal= {arXiv preprint arXiv:2509.10710},
  year   = {2025}
}

备注

Accepted at GCPR 2025