中文

基于姿态的图卷积网络与BERT手语识别

计算机视觉与模式识别 2020-12-03 v1

摘要

手语识别(SLR)在缩小听障及发声障碍群体与社会其他成员之间的沟通鸿沟方面起着关键作用。词级手语识别(WSLR)是理解和解释手语的第一个重要步骤。然而,从视频中识别手势是一项具有挑战性的任务,因为一个词的含义取决于细微身体动作、手部构型和其他运动的组合。近期用于WSLR的基于姿态的架构要么同时建模不同帧间姿态的空间与时间依赖,要么仅建模时间信息而未充分利用空间信息。我们采用一种新颖的基于姿态的方法解决WSLR问题,该方法分别捕获空间与时间信息并进行后期融合。我们提出的架构使用图卷积网络(GCN)显式捕获视频中的空间交互。帧间的时间依赖使用来自Transformers的双向编码器表示(BERT)捕获。在WLASL(一个标准词级手语识别数据集)上的实验结果表明,我们的模型显著优于基于姿态方法的最先进水平,预测准确率提升高达5%。

关键词

引用

@article{arxiv.2012.00781,
  title  = {Pose-based Sign Language Recognition using GCN and BERT},
  author = {Anirudh Tunga and Sai Vidyaranya Nuthalapati and Juan Wachs},
  journal= {arXiv preprint arXiv:2012.00781},
  year   = {2020}
}