中文

ZS-SLR:基于 RGB-D 视频的零样本手语识别

计算机视觉与模式识别 2021-08-24 v1 人机交互

摘要

手语识别(SLR)是计算机视觉中一个具有挑战性的研究领域。为应对 SLR 中的标注瓶颈,我们形式化了零样本手语识别(ZS-SLR)问题,并提出了一种来自两种输入模态(RGB 与深度视频)的双流模型。为利用视觉 Transformer 的能力,我们使用两个视觉 Transformer 模型分别进行人体检测与视觉特征表示。我们配置了一种 transformer 编码器-解码器架构作为快速准确的人体检测模型,以克服当前人体检测模型的挑战。考虑人体关键点,将检测到的人体分割为九个部分。使用视觉 Transformer 与 LSTM 网络获得人体的时空表示。一个语义空间通过 Bidirectional Encoder Representations from Transformers(BERT)模型将视觉特征映射到类标签的语言嵌入。我们在 Montalbano II、MSR Daily Activity 3D、CAD-60 和 NTU-60 四个数据集上评估了所提模型,相比最先进的 ZS-SLR 模型取得了最优结果。

关键词

引用

@article{arxiv.2108.10059,
  title  = {ZS-SLR: Zero-Shot Sign Language Recognition from RGB-D Videos},
  author = {Razieh Rastgoo and Kourosh Kiani and Sergio Escalera},
  journal= {arXiv preprint arXiv:2108.10059},
  year   = {2021}
}