中文

用于美国手语识别的生成式多流架构

计算机视觉与模式识别 2020-03-20 v1

摘要

随着深度模型架构的发展,只要在适当的数据预处理和模型参数初始化下,计算机视觉任务便可达到最优收敛。然而,在特征丰富度低的数据集上训练复杂应用会限制并损害最优收敛,使其低于人类表现。在以往工作中,研究者以额外硬件为代价提供互补数据的外部来源,并以流的形式输入以抵消此限制并提升性能。我们提出一种生成式多流架构,消除了对额外硬件的需求,旨在不冒不可行风险地改善特征丰富度。我们还将紧凑时空残差块引入标准三维卷积模型 C3D。我们的 rC3D 模型在 FASL-RGB 数据集上表现与顶尖的 C3D 残差变体架构伪三维(pseudo-3D)模型相当。我们的方法取得了 95.62% 的验证准确率,与训练的方差为 1.42%,在验证准确率上超越过往模型 0.45%,在方差上超越 5.53%。

关键词

引用

@article{arxiv.2003.08743,
  title  = {Generative Multi-Stream Architecture For American Sign Language Recognition},
  author = {Dom Huh and Sai Gurrapu and Frederick Olson and Huzefa Rangwala and Parth Pathak and Jana Kosecka},
  journal= {arXiv preprint arXiv:2003.08743},
  year   = {2020}
}