中文

一种面向真实场景下手指字母拼读识别的细粒度视觉注意力方法

计算机视觉与模式识别 2021-08-24 v2

摘要

手语中的手指字母拼读用于在缺乏专用手势时交流技术术语和专有名词。手指字母拼读的自动识别有助于消除与聋人交流时的沟通障碍。手指字母拼读识别中普遍存在的挑战是手势的模糊性和手部强烈的动作表达。自动识别模型应解决手势间较高的视觉相似性和类内较大的变化。现有大多数手指字母拼读识别研究都集中于在受控环境中收集的数据集。近期从社交媒体和在线平台收集的大规模真实场景标注手指字母拼读数据集,捕捉了真实世界场景中的挑战。在本工作中,我们提出一种使用 Transformer 模型的细粒度视觉注意力机制,用于真实场景数据集上的序列到序列预测任务。细粒度注意力通过利用视频帧的运动变化(光流)在基于序列上下文的注意力中结合 Transformer 编码器模型来实现。未分段的连续视频数据集通过平衡连接时序分类(CTC)损失和最大熵损失进行联合训练。所提方法能在单次迭代中捕获更好的细粒度注意力。实验评估表明其优于当前最优(SOTA)方法。

关键词

引用

@article{arxiv.2105.07625,
  title  = {A Fine-Grained Visual Attention Approach for Fingerspelling Recognition in the Wild},
  author = {Kamala Gajurel and Cuncong Zhong and Guanghui Wang},
  journal= {arXiv preprint arXiv:2105.07625},
  year   = {2021}
}

备注

7 pages, 3 figures