PiSLTRc:具备内容感知卷积的位置信息增强手语Transformer
计算机视觉与模式识别
2021-07-28 v1
摘要
鉴于Transformer在学习长程依赖方面的优越性,手语Transformer模型在手语识别(SLR)与手语翻译(SLT)中取得了显著进展。然而,Transformer存在若干限制其更好理解手语的问题。第一个问题是自注意力机制以帧级方式学习手语视频表征,忽略了手势的时间语义结构。其次,带有绝对位置编码的注意力机制无法感知方向与距离,从而限制了其能力。为解决这些问题,我们提出了一种新模型架构,即PiSLTRc,具有两个显著特点:(i)内容感知与位置感知卷积层。具体而言,我们使用一种新颖的内容感知邻域聚合方法显式选择相关特征,随后通过位置信息增强的时间卷积层聚合这些特征,从而生成鲁棒的邻域增强手语表征。(ii)将相对位置信息注入编码器、解码器乃至编码器-解码器交叉注意力中的注意力机制。与原始Transformer模型相比,我们的模型在PHOENIX-2014、PHOENIX-2014-T和CSL三个大规模手语基准上表现持续更优。此外,大量实验表明,所提方法在翻译质量上取得了最先进的性能,BLEU提升达。
引用
@article{arxiv.2107.12600,
title = {PiSLTRc: Position-informed Sign Language Transformer with Content-aware Convolution},
author = {Pan Xie and Mengyi Zhao and Xiaohui Hu},
journal= {arXiv preprint arXiv:2107.12600},
year = {2021}
}