中文

TSPNet:基于时间语义金字塔的手语翻译层次化特征学习

计算机视觉与模式识别 2020-10-13 v1 人工智能 人机交互 多媒体

摘要

手语翻译(SLT)旨在将手语视频序列解释为基于文本的自然语言句子。手语视频由连续的手势序列组成,其间无清晰边界。现有 SLT 模型通常以逐帧方式表示手语视觉特征,以避免需将视频显式分割为孤立手势。然而,这些方法忽略了手势的时间信息,导致翻译中存在大量歧义。本文探索手语视频的时间语义结构以学习更具判别性的特征。为此,我们首先提出一种新颖的手语视频片段表示,其考虑了多种时间粒度,从而缓解了对准确视频分割的需求。利用所提片段表示,我们开发了一种通过时间语义金字塔网络(称为 TSPNet)的新颖层次化手语视频特征学习方法。具体而言,TSPNet 引入尺度间注意力以评估并增强手语片段的局部语义一致性,以及尺度内注意力以利用非局部视频上下文解决语义歧义。实验表明,在最大常用 SLT 数据集上,我们的 TSPNet 以 BLEU 分数(从 9.58 到 13.41)和 ROUGE 分数(从 31.80 到 34.96)的显著提升优于当前最优方法。我们的实现见 https://github.com/verashira/TSPNet。

关键词

引用

@article{arxiv.2010.05468,
  title  = {TSPNet: Hierarchical Feature Learning via Temporal Semantic Pyramid for Sign Language Translation},
  author = {Dongxu Li and Chenchen Xu and Xin Yu and Kaihao Zhang and Ben Swift and Hanna Suominen and Hongdong Li},
  journal= {arXiv preprint arXiv:2010.05468},
  year   = {2020}
}

备注

NeurIPS 2020 preprint