从RGB-D视频中识别美国手语手势
计算机视觉与模式识别
2019-06-10 v1
摘要
在本文中,我们提出一种基于三维卷积神经网络(3DCNN)的多流框架,通过融合多模态特征(包括来自多通道(RGB、深度、运动与骨架关节)的手势、面部表情和身体姿态),从RGB-D视频中实时识别美国手语(ASL)手势(在某些情况下由手部运动以及非手部面部运动组成)。为学习视频中的整体时间动态,通过为每个视频选取子集帧生成代理视频,随后用于训练所提3DCNN模型。我们收集了一个新的ASL数据集ASL-100-RGBD,包含由Microsoft Kinect V2相机捕获的42段RGB-D视频,每段含100个ASL手势,包括RGB通道、深度图、骨架关节、面部特征与HDface。该数据集对每个语义区域(即人形签署者执行每个词的时间持续时间)进行了完整标注。我们提出的方法在 newly collected ASL-100-RGBD数据集中识别100个ASL词的准确率达到92.88。我们的框架从RGB-D视频识别手势的有效性进一步在Chalearn IsoGD数据集上得到验证,准确率达76,较先前工作仅用5通道而非12通道的平均融合最优工作高出5.51。
引用
@article{arxiv.1906.02851,
title = {Recognizing American Sign Language Manual Signs from RGB-D Videos},
author = {Longlong Jing and Elahe Vahdani and Matt Huenerfauth and Yingli Tian},
journal= {arXiv preprint arXiv:1906.02851},
year = {2019}
}