中文

SLGTformer:一种基于注意力的手语识别方法

计算机视觉与模式识别 2022-12-26 v2

摘要

手语是聋人或哑人的首选交流方式,但如同任何语言一样,它难以学习,并对听障或失语者构成重大障碍。人的整个正面外观决定并传达特定含义。然而,该正面外观可量化为人体姿态的时间序列,从而通过学习骨架关键点的时空动态实现手语识别。我们提出一种新颖的、基于注意力的手语识别方法,其完全构建于解耦的图与时间自注意力之上:手语图时间 Transformer(SLGTformer)。SLGTformer 首先将时空姿态序列分别解构为空间图与时间窗。随后,SLGTformer 利用新颖的可学习图相对位置编码(LGRPE),以人体骨架的图邻域上下文引导空间自注意力。通过将时间维度建模为窗内与窗间动态,我们引入时间孪生自注意力(TTSA),作为局部分组时间注意力(LTA)与全局子采样时间注意力(GSTA)的组合。我们在世界级美国手语(WLASL)数据集上展示了 SLGTformer 的有效性,在关键点模态上以无集成方法取得了最先进的性能。代码见 https://github.com/neilsong/slt

关键词

引用

@article{arxiv.2212.10746,
  title  = {SLGTformer: An Attention-Based Approach to Sign Language Recognition},
  author = {Neil Song and Yu Xiang},
  journal= {arXiv preprint arXiv:2212.10746},
  year   = {2022}
}

备注

12 pages, 3 figures