中文

利用无标签数据进行多任务训练的端到端手语手指拼写识别

计算与语言 2019-02-19 v2 计算机视觉与模式识别

摘要

我们解决从视频中自动识别美国手语手指拼写的问题。先前的工作在很大程度上依赖于帧级标签、手工制作的特征或其他约束,并受到该任务数据稀缺的阻碍。我们引入了一个手指拼写识别模型来解决这些问题。该模型由一个基于自编码器的特征提取器和一个基于注意力的神经编码器-解码器组成,它们被联合训练。模型接收一系列图像帧并输出手指拼写的单词,无需依赖任何帧级训练标签或手工制作的特征。此外,自编码器子组件使得利用无标签数据来改进特征学习成为可能。与先前需要帧级训练标签的方法相比,该模型在签名者独立和签名者适应的手指拼写识别中,分别实现了 11.6% 和 4.4% 的绝对字母准确率提升。

关键词

引用

@article{arxiv.1710.03255,
  title  = {Multitask training with unlabeled data for end-to-end sign language fingerspelling recognition},
  author = {Bowen Shi and Karen Livescu},
  journal= {arXiv preprint arXiv:1710.03255},
  year   = {2019}
}