中文

骨架图自注意力:将骨架归纳偏置嵌入手语生成

计算机视觉与模式识别 2021-12-13 v1 计算与语言

摘要

近期手语生成(SLP)的方法采用了口语神经机器翻译(NMT)架构,且未做手语特定的修改。此外,这些工作将手语表示为骨架姿态向量序列,投影为无固有骨架结构的抽象表示。本文中,我们将手语序列表示为骨架图结构,以关节为节点、空间与时间连接为边。为处理该图结构,我们提出骨架图自注意力(SGSA),一种将骨架归纳偏置嵌入 SLP 模型的新型图注意力层。我们始终保留骨架特征表示,直接将时空邻接矩阵应用于自注意力公式中。这为各骨架关节提供了非图抽象表示所不可能具备的结构与上下文,从而实现流畅且富有表现力的手语生成。我们在具挑战性的 RWTH-PHOENIX-Weather-2014T(PHOENIX14T) 数据集上评估了骨架图自注意力架构,取得了最先进的反向翻译性能,在开发集和测试集上分别比竞争方法提升 8% 和 7%。

关键词

引用

@article{arxiv.2112.05277,
  title  = {Skeletal Graph Self-Attention: Embedding a Skeleton Inductive Bias into Sign Language Production},
  author = {Ben Saunders and Necati Cihan Camgoz and Richard Bowden},
  journal= {arXiv preprint arXiv:2112.05277},
  year   = {2021}
}