中文

基于树结构骨架图像的孤立手语识别

计算机视觉与模式识别 2023-04-13 v1

摘要

手语识别(SLR)系统旨在嵌入视频流平台,以识别摄像头前所打的手势。SLR 研究借助近期姿态估计模型的进展,使用从视频中估计出的骨架序列替代 RGB 信息来预测手势。该方法可使 HAR 相关任务对多样背景、光照条件和外貌的复杂度更低、鲁棒性更强。本文中,我们探索使用一种时空骨架表示——树结构骨架图像(TSSI)作为替代输入,以提升基于骨架的 SLR 模型精度。TSSI 将骨架序列转换为一幅 RGB 图像,其中列按深度优先树遍历顺序表示骨架的关节,行表示关节的时间演化,三个通道表示关节的 (x, y, z) 坐标。我们使用此类输入训练了一个 DenseNet-121,并在大规模美国手语(ASL)数据集 WLASL 上与其他基于骨架的深度学习方法进行比较。我们的模型(SL-TSSI-DenseNet)超越了其他基于骨架模型的 SOTA。此外,当加入数据增强后,我们的方案取得了优于基于骨架和基于 RGB 模型的结果。我们在安卡拉大学土耳其手语(TSL)数据集 AUTSL 和墨西哥手语(LSM)数据集上评估了模型有效性。在 AUTSL 数据集上,模型取得了与其他基于骨架模型 SOTA 相近的结果。在 LSM 数据集上,模型取得了高于基线的结果。代码已公开于:https://github.com/davidlainesv/SL-TSSI-DenseNet。

关键词

引用

@article{arxiv.2304.05403,
  title  = {Isolated Sign Language Recognition based on Tree Structure Skeleton Images},
  author = {David Laines and Gissella Bejarano and Miguel Gonzalez-Mendoza and Gilberto Ochoa-Ruiz},
  journal= {arXiv preprint arXiv:2304.05403},
  year   = {2023}
}

备注

This paper has been accepted the the LatinX in Computer Vision Research Workshop at CVPR 2023