中文

ArabSign:面向连续阿拉伯手语识别的多模态数据集与基准

计算机视觉与模式识别 2022-10-11 v1

摘要

近年来,手语识别引起了研究人员的兴趣。尽管针对欧洲和亚洲手语识别已提出众多方法,但为阿拉伯手语(ArSL)开发类似系统的尝试非常有限。这部分可归因于缺乏句子级别的数据集。在本文中,我们旨在通过提出 ArabSign(一个连续 ArSL 数据集)做出重要贡献。所提出的数据集由 6 名手语者执行的 9,335 个样本组成。所录制句子的总时长约为 10 小时,平均句子长度为 3.1 个手势。ArabSign 数据集使用 Kinect V2 相机录制,该相机为每句话同时提供三类信息(彩色、深度和骨架关节点)。此外,我们根据 ArSL 和阿拉伯语结构提供数据集的标注,有助于研究 ArSL 的语言特征。为对该数据集进行基准测试,我们提出一种用于连续 ArSL 识别的编码器-解码器模型。该模型在提出的数据集上进行了评估,所得结果表明编码器-解码器模型优于注意力机制,其平均词错误率(WER)为 0.50,而注意力机制为 0.62。数据和代码可在 github.com/Hamzah-Luqman/ArabSign 获取。

关键词

引用

@article{arxiv.2210.03951,
  title  = {ArabSign: A Multi-modality Dataset and Benchmark for Continuous Arabic Sign Language Recognition},
  author = {Hamzah Luqman},
  journal= {arXiv preprint arXiv:2210.03951},
  year   = {2022}
}

备注

8