基于多模态数据的手语识别分析
机器学习
2019-09-26 v1 计算与语言
计算机视觉与模式识别
机器学习
摘要
声控个人及家庭助手(如 Amazon Echo 与 Apple Siri)正因各类应用而日益普及。然而,这些技术的便利尚不易被聋人或重听(DHH)用户所享有。本研究的目的是开发并评估一种使用多模态数据的手语识别系统,供 DHH 手语者用以与声控设备交互。随着深度传感器的进步,骨骼数据已被用于视频分析与活动识别等应用。尽管与人类活动识别研究相似,3D 骨骼数据在手语识别中的使用却很少见,这是因为手语不同于活动识别,主要依赖手形模式。本工作中,我们结合不同深度学习架构,探究使用骨骼与 RGB 视频数据进行手语识别的可行性。我们在一个大规模美国手语(ASL)数据集上验证结果,该集含 12 名用户、跨 51 个手势共 13107 个样本,命名为 GMUASL51。我们历时 6 个月采集该数据集,并将公开发布,以期推动面向数字助手可及性提升的进一步机器学习研究。
引用
@article{arxiv.1909.11232,
title = {Sign Language Recognition Analysis using Multimodal Data},
author = {Al Amin Hosain and Panneer Selvam Santhalingam and Parth Pathak and Jana Kosecka and Huzefa Rangwala},
journal= {arXiv preprint arXiv:1909.11232},
year = {2019}
}
备注
conference : IEEE DSAA, 2019, Washington DC