中文

用于连续手语识别的多尺度时序网络

计算机视觉与模式识别 2022-08-17 v2

摘要

连续手语识别(CSLR)是一项具有挑战性的研究任务,原因在于手语数据时间序列上缺乏准确标注。近期流行的方法是基于“CNN + RNN”的混合模型用于 CSLR。然而,在这些工作提取时序特征时,大多数方法使用固定的时序感受野,无法针对每个手语词很好地提取时序特征。为了获得更精确的时序特征,本文提出了一种多尺度时序网络(MSTNet)。该网络主要由三部分组成。ResNet 和两个全连接(FC)层构成逐帧特征提取部分。时序特征提取部分首先利用所提出的多尺度时序块(MST-block)提取不同尺度的时序感受野特征以提升时序建模能力,然后通过 transformers 模块进一步编码不同尺度的时序特征,从而获得更精确的时序特征。最后,所提出的多级连接主义时序分类(CTC)损失部分用于训练以得到识别结果。多级 CTC 损失能够更好地学习和更新 CNN 中的浅层网络参数,该方法无参数增加且可灵活嵌入其他模型。在两个公开数据集上的实验结果表明,我们的方法无需任何先验知识即可端到端地有效提取手语特征,提高了 CSLR 的准确率并取得了具有竞争力的结果。

关键词

引用

@article{arxiv.2204.03864,
  title  = {Multi-scale temporal network for continuous sign language recognition},
  author = {Qidan Zhu and Jing Li and Fei Yuan and Quan Gan},
  journal= {arXiv preprint arXiv:2204.03864},
  year   = {2022}
}

备注

10 pages, 7 figures