中文

SignBERT:用于手语识别的具手模型感知表征自监督预训练

计算机视觉与模式识别 2021-10-12 v1

摘要

手势在手语中起着关键作用。当前基于深度学习的手语识别(SLR)方法可能因手语数据来源有限而面临可解释性不足与过拟合问题。本文中,我们提出首个可自监督预训练的、融合手部先验的 SignBERT 用于 SLR。SignBERT 将手部姿态视为视觉 token,该 token 由现成的姿态提取器得到。随后将这些视觉 token 嵌入手势状态、时间以及手部手性信息。为充分利用可用手语数据来源,SignBERT 首先通过掩码与重建视觉 token 进行自监督预训练。结合若干掩码建模策略,我们尝试以模型感知方式融入手部先验,以更好地对手部序列上的层次化上下文建模。随后添加预测头,对 SignBERT 进行微调以执行下游 SLR 任务。为验证我们的方法在 SLR 上的有效性,我们在四个公开基准数据集(即 NMFs-CSL、SLR500、MSASL 和 WLASL)上进行了大量实验。实验结果证明了自监督学习与引入手部先验的有效性。此外,我们在所有基准上以显著优势取得了最先进(state-of-the-art)性能。

关键词

引用

@article{arxiv.2110.05382,
  title  = {SignBERT: Pre-Training of Hand-Model-Aware Representation for Sign Language Recognition},
  author = {Hezhen Hu and Weichao Zhao and Wengang Zhou and Yuechen Wang and Houqiang Li},
  journal= {arXiv preprint arXiv:2110.05382},
  year   = {2021}
}

备注

ICCV 2021