基于视频的词级深度手语识别:一个新的大规模数据集与方法比较
计算机视觉与模式识别
2020-01-22 v2 人机交互
多媒体
神经与进化计算
摘要
基于视觉的手语识别旨在帮助聋人与他人交流。然而,大多数现有手语数据集仅限于少量词汇。由于词汇规模有限,从这些数据集中学习到的模型无法在实际应用中部署。本文我们引入一个新的大规模词级美国手语(WLASL)视频数据集,包含由超过 100 名手语者演绎的 2000 余个词汇。该数据集将向公众开放以供研究使用。据我们所知,这是迄今为止最大的公开 ASL 数据集,以促进词级手语识别研究。基于这一新的大规模数据集,我们得以实验多种深度学习方法来开展词级手语识别,并评估其在大规模场景下的性能。具体而言,我们实现并比较了两种不同的模型,即(i)基于整体视觉外观的方法,与(ii)基于 2D 人体姿态的方法。两种模型均为有益于社区进行方法基准测试的宝贵基线。此外,我们还提出了一种新颖的基于姿态的时空图卷积网络(Pose-TGCN),可同时建模人体姿态轨迹中的空间与时间依赖关系,进一步提升了基于姿态方法的性能。我们的结果显示,在 2000 个词/词义上,基于姿态与基于外观的模型在 top-10 准确率上取得了最高 66% 的相当性能,证明了我们数据集的有效性与挑战性。我们的数据集与基线深度模型可在 \url{https://dxli94.github.io/WLASL/} 获取。
引用
@article{arxiv.1910.11006,
title = {Word-level Deep Sign Language Recognition from Video: A New Large-scale Dataset and Methods Comparison},
author = {Dongxu Li and Cristian Rodriguez Opazo and Xin Yu and Hongdong Li},
journal= {arXiv preprint arXiv:1910.11006},
year = {2020}
}
备注
Accepted by WACV2020, First Round, camera-ready version