中文

面向连续手语识别的时空多线索网络

计算机视觉与模式识别 2020-02-11 v1

摘要

尽管深度学习在连续手语识别(CSLR)中近期取得成功,深度模型通常聚焦于最具判别性的特征,忽略其他潜在重要且具信息量的内容。该特性严重制约其学习不同视觉线索(即手形、面部表情与身体姿态)协作背后的隐式视觉语法之能力。通过将多线索学习注入神经网络设计,我们提出时空多线索(STMC)网络以解决基于视觉的序列学习问题。我们的 STMC 网络由空间多线索(SMC)模块与时间多线索(TMC)模块组成。SMC 模块专用于空间表示,并借助自包含姿态估计分支显式分解不同线索的视觉特征。TMC 模块沿两条并行路径(即线索内与线索间)建模时间关联,旨在保持多线索独特性并探索其协作。最后,我们设计联合优化策略以实现 STMC 网络的端到端序列学习。为验证有效性,我们在三个大规模 CSLR 基准上实验:PHOENIX-2014、CSL 与 PHOENIX-2014-T。实验结果表明所提方法在所有三个基准上均取得新的 SOTA 性能。

关键词

引用

@article{arxiv.2002.03187,
  title  = {Spatial-Temporal Multi-Cue Network for Continuous Sign Language Recognition},
  author = {Hao Zhou and Wengang Zhou and Yun Zhou and Houqiang Li},
  journal= {arXiv preprint arXiv:2002.03187},
  year   = {2020}
}

备注

Accepted as an oral presentation paper at AAAI 2020. (To appear in Proceedings of the Thirty-Fourth AAAI Conference on Artificial Intelligence)