基于骨架感知的多模态手语识别
摘要
手语通常被聋人或言语障碍者用于交流,但掌握它需要付出相当大的努力。手语识别(SLR)旨在通过对给定视频中的手势进行识别,来弥合手语使用者与他人之间的鸿沟。这是一项重要而富有挑战性的任务,因为手语是通过手势、身体姿态乃至面部表情的快速而复杂的运动来完成的。近年来,基于骨架的动作识别因主体与背景变化之间的独立性而受到越来越多的关注。然而,由于缺乏手部关键点标注,基于骨架的 SLR 仍处在探索阶段。已有一些工作尝试使用手部检测器与姿态估计器来提取手部关键点,并通过神经网络学习识别手语,但它们均未能超越基于 RGB 的方法。为此,我们提出了一种新颖的骨架感知多模态 SLR 框架(SAM-SLR),以利用多模态信息获得更高的识别率。具体而言,我们提出了一种手语图卷积网络(SL-GCN)来建模内蕴的动态特征,以及一种新颖的可分离时空卷积网络(SSTCN)来挖掘骨架特征。RGB 与深度模态也被纳入我们的框架,并融合进来以提供对基于骨架的方法 SL-GCN 和 SSTCN 起补充作用的全局信息。结果表明,SAM-SLR 在 2021 Looking at People 大规模说话人无关孤立 SLR 挑战赛中,于 RGB(98.42%)与 RGB-D(98.53%)两个赛道均取得了最高性能。我们的代码已发布于 https://github.com/jackyjsy/CVPR21Chal-SLR。
引用
@article{arxiv.2103.08833,
title = {Skeleton Aware Multi-modal Sign Language Recognition},
author = {Songyao Jiang and Bin Sun and Lichen Wang and Yue Bai and Kunpeng Li and Yun Fu},
journal= {arXiv preprint arXiv:2103.08833},
year = {2021}
}
备注
This is a preprint version of our work SAM-SLR that ranked 1st at CVPR2021 Challenge on Large Scale Signer Independent Isolated Sign Language Recognition