中文

用于高效连续手语识别的时间叠加交叉模块

计算机视觉与模式识别 2023-04-04 v3

摘要

连续手语识别(CSLR)的最终目标是促进特殊人群与正常人群之间的交流,这要求模型具备一定程度的实时性与可部署性。然而,在以往 CSLR 研究中,很少关注实时性与可部署性。为提升模型的实时性与可部署性,本文提出零参数、零计算量的时间叠加交叉模块(TSCM),并将其与 2D 卷积结合形成“TSCM+2D 卷积”混合卷积,使 2D 卷积具备强时空建模能力,且相较于其他时空卷积,参数零增加、部署成本更低。基于 TSCM 的整体 CSLR 模型构建于本文改进的 ResBlockT 网络之上。将“TSCM+2D 卷积”混合卷积应用于 ResNet 网络的 ResBlock 以构成新 ResBlockT,并引入随机梯度停止与多级 CTC 损失训练模型,在降低训练内存占用的同时降低了最终识别 WER,并将 ResNet 网络从图像分类任务扩展至视频识别任务。此外,本研究在 CSLR 中首次仅使用 2D 卷积提取手语视频时空特征进行端到端识别学习。在两个大规模连续手语数据集上的实验证明了所提方法的有效性并取得了极具竞争力的结果。

关键词

引用

@article{arxiv.2211.03387,
  title  = {Temporal superimposed crossover module for effective continuous sign language},
  author = {Qidan Zhu and Jing Li and Fei Yuan and Quan Gan},
  journal= {arXiv preprint arXiv:2211.03387},
  year   = {2023}
}

备注

10 pages, 7 figures