中文

基于骨架感知多模型集成的手语识别

计算机视觉与模式识别 2021-10-13 v1 人工智能

摘要

手语通常被聋人或哑人用于交流, 但需要大量精力才能掌握。它通常通过手势、身体姿态乃至面部表情的快速而精细的动作完成。当前的手语识别 (SLR) 方法通常通过深度神经网络提取特征, 并因有限且含噪的数据而受过拟合困扰。近来, 基于骨架的动作识别因其对主体和背景的不变性而受到越来越多的关注, 而基于骨架的 SLR 仍因缺乏手部标注而在探索中。一些研究者尝试使用离线手部姿态跟踪器获取手部关键点, 并通过循环神经网络辅助识别手语。然而, 它们均尚未超越基于 RGB 的方法。为此, 我们提出一种带有全局集成模型 (GEM) 的新颖骨架感知多模态框架 (SAM-SLR-v2), 用于孤立 SLR, 以学习并融合多模态特征表示从而获得更高的识别率。具体而言, 我们提出手语图卷积网络 (SL-GCN) 来建模骨架关键点的内在动态, 并提出可分离时空卷积网络 (SSTCN) 来利用骨架特征。基于骨架的预测通过所提出的后期融合 GEM 与其他基于 RGB 和深度的模态融合, 以提供全局信息并作出可靠的 SLR 预测。在三个孤立 SLR 数据集上的实验表明, 我们提出的 SAM-SLR-v2 框架极为有效, 并以显著优势达到了最先进的性能。我们的代码将发布于 https://github.com/jackyjsy/SAM-SLR-v2

关键词

引用

@article{arxiv.2110.06161,
  title  = {Sign Language Recognition via Skeleton-Aware Multi-Model Ensemble},
  author = {Songyao Jiang and Bin Sun and Lichen Wang and Yue Bai and Kunpeng Li and Yun Fu},
  journal= {arXiv preprint arXiv:2110.06161},
  year   = {2021}
}