中文

用于手语识别的分数级多线索融合

计算机视觉与模式识别 2020-09-30 v1

摘要

手语通过手与上身手势以及面部表情表达。因此,手语识别(SLR)需关注所有此类线索。已有工作使用手工机制或网络聚合来提取不同线索特征以提升 SLR 性能。这速度慢且涉及复杂架构。我们提出一种更简洁的方法,专注于训练分别专精于优势手、双手、面部与上身区域的线索模型。我们比较了专精于这些区域的 3D 卷积神经网络(CNN)模型性能,通过分数级融合加以组合,并采用加权方案。实验结果显示了混合卷积模型的有效性。其融合相较使用完整上身的基线取得了最高 19% 的准确率提升。此外,我们包含了对融合设置的讨论,可助益未来手语翻译(SLT)相关工作。

关键词

引用

@article{arxiv.2009.14139,
  title  = {Score-level Multi Cue Fusion for Sign Language Recognition},
  author = {Çağrı Gökçe and Oğulcan Özdemir and Ahmet Alp Kındıroğlu and Lale Akarun},
  journal= {arXiv preprint arXiv:2009.14139},
  year   = {2020}
}