在孤立手语识别中使用运动历史图像与三维卷积网络
计算机视觉与模式识别
2022-02-21 v2
摘要
使用计算模型进行手语识别是一个具有挑战性的问题,需要同时对人脸、手、身体等多种来源的时空建模。本文提出一种基于运动历史图像(MHI)训练的模型的孤立手语识别模型,该图像由RGB视频帧生成。RGB-MHI图像在单张RGB图像中有效表示了每个手语视频的时空摘要。我们提出两种使用该RGB-MHI模型的方法。第一种方法中,我们将RGB-MHI模型作为基于运动的空间注意力模块集成到3D-CNN架构中。第二种方法中,我们通过晚期融合技术将RGB-MHI模型特征与3D-CNN模型特征直接使用。我们在两个近期发布的大规模孤立手语数据集AUTSL和BosphorusSign22k上进行了充分实验。实验表明,仅使用RGB数据的模型可与文献中使用多模态数据的SOTA模型相竞争。
引用
@article{arxiv.2110.12396,
title = {Using Motion History Images with 3D Convolutional Networks in Isolated Sign Language Recognition},
author = {Ozge Mercanoglu Sincan and Hacer Yalim Keles},
journal= {arXiv preprint arXiv:2110.12396},
year = {2022}
}