中文

用于连续手语识别的多视角时空网络

计算机视觉与模式识别 2022-04-20 v1

摘要

手语是一种优美的视觉语言,也是听力和言语障碍人士使用的主要语言。然而,手语具有许多复杂的表达,公众难以理解和掌握。手语识别算法将极大促进听障人士与正常人之间的交流。传统的连续手语识别常使用基于卷积神经网络(CNN)和长短期记忆网络(LSTM)的序列学习方法。这些方法只能分别学习空间和时间特征,无法学习手语复杂的时空特征。LSTM 也难以学习长期依赖关系。为缓解这些问题,本文提出一种多视角时空连续手语识别网络。该网络由三部分组成。第一部分是多视角时空特征提取网络(MSTN),可直接提取 RGB 和骨架数据的时空特征;第二部分是基于 Transformer 的手语编码器网络,可学习长期依赖关系;第三部分是连接时序分类(CTC)解码器网络,用于预测连续手语的完整含义。我们的算法在两个公开手语数据集 SLR-100 和 PHOENIX-Weather 2014T(RWTH)上进行了测试。结果表明,我们的方法在两个数据集上均取得了优异性能。在 SLR-100 数据集上的词错误率为 1.9%,在 RWTHPHOENIX-Weather 数据集上的词错误率为 22.8%。

关键词

引用

@article{arxiv.2204.08747,
  title  = {Multi-View Spatial-Temporal Network for Continuous Sign Language Recognition},
  author = {Ronghui Li and Lu Meng},
  journal= {arXiv preprint arXiv:2204.08747},
  year   = {2022}
}

备注

12 pages, 4 figures