How2Sign:用于连续美国手语的大规模多模态数据集
计算机视觉与模式识别
2021-04-02 v2
摘要
阻碍手语识别、翻译和生成领域进展的因素之一是缺乏大型标注数据集。为此,我们介绍了How2Sign,一个多模态多视角的连续美国手语(ASL)数据集,由超过80小时手语视频的平行语料库以及一组相应模态组成,包括语音、英文转录和深度信息。进一步在Panoptic工作室录制了三小时子集,以支持详细的3D姿态估计。为评估How2Sign的实际影响潜力,我们与ASL手语者开展了一项研究,表明使用我们数据集合成的视频确实可以被理解。该研究进一步给出了计算机视觉为在该领域取得进展所需应对的挑战的见解。数据集网站:http://how2sign.github.io/
引用
@article{arxiv.2008.08143,
title = {How2Sign: A Large-scale Multimodal Dataset for Continuous American Sign Language},
author = {Amanda Duarte and Shruti Palaskar and Lucas Ventura and Deepti Ghadiyaram and Kenneth DeHaan and Florian Metze and Jordi Torres and Xavier Giro-i-Nieto},
journal= {arXiv preprint arXiv:2008.08143},
year = {2021}
}
备注
Accepted at CVPR 2021. Dataset website: http://how2sign.github.io/