中文

StepNet:用于孤立手语识别的时空部件感知网络

计算机视觉与模式识别 2024-04-09 v2

摘要

手语识别(SLR)旨在帮助听障或聋人克服沟通障碍。现有多数方法可分为两类,即基于骨架与基于 RGB 的方法,但这两类方法均有其局限。基于骨架的方法未考虑面部表情,而基于 RGB 的方法通常忽略细粒度手部结构。为克服上述局限,我们提出一种基于 RGB 部件的称为时空部件感知网络(StepNet)的新框架。顾名思义,其由两部分组成:部件级空间建模与部件级时间建模。具体而言,部件级空间建模在特征空间中自动捕获基于外观的属性(如手与脸),无需任何关键点级标注。另一方面,部件级时间建模隐式挖掘长短时上下文以随时间捕获相关属性。大量实验表明,得益于时空模块,我们的 StepNet 在三个常用 SLR 基准上取得了具竞争力的 Top-1 每实例准确率,即在 WLASL 上为 56.89%、在 NMFs-CSL 上为 77.2%、在 BOBSL 上为 77.1%。此外,所提方法兼容光流输入,融合后可产生更优性能。对于听障人士,我们希望我们的工作能作为初步的一步。

关键词

引用

@article{arxiv.2212.12857,
  title  = {StepNet: Spatial-temporal Part-aware Network for Isolated Sign Language Recognition},
  author = {Xiaolong Shen and Zhedong Zheng and Yi Yang},
  journal= {arXiv preprint arXiv:2212.12857},
  year   = {2024}
}