MS-ASL:用于美国手语理解的大规模数据集与基准
计算机视觉与模式识别
2019-11-22 v2
摘要
手语识别是一个具有挑战性且常被低估的问题,其包含多模态发音器(手形、朝向、运动、上半身与面部),这些模态在多个流上异步整合。在此场景下学习强大的统计模型需要大量数据,尤其是为了应用该领域近期的进展。然而,由于转录这些无文字语言的成本极高,标注数据在手语中是稀缺资源。我们提出了首个真实场景下的大规模手语数据集,包含超过 25,000 段标注视频,并使用来自手语及相关动作识别的最先进方法对其进行了详尽评估。与当前最先进技术不同,该数据集允许在超过 200 名手语者的真实场景中研究对未见个体的泛化能力(独立于手语者测试)。先前工作大多处理有限词汇任务,而在此我们覆盖了在极具挑战性且无约束的真实录制条件下的 1000 个手势的大类数。我们进一步提出来自视频分类的 I3D 作为一种强大且适用于手语识别的架构,大幅优于当前最先进技术。该数据集已向公众开放。
引用
@article{arxiv.1812.01053,
title = {MS-ASL: A Large-Scale Data Set and Benchmark for Understanding American Sign Language},
author = {Hamid Reza Vaezi Joze and Oscar Koller},
journal= {arXiv preprint arXiv:1812.01053},
year = {2019}
}