中文

面向无注释手语翻译的注释注意力机制

计算机视觉与模式识别 2023-07-17 v1 计算与语言

摘要

迄今为止,大多数手语翻译(SLT)方法需要使用手语注释(gloss)以提供额外的监督信息,然而注释的获取并不容易。为解决此问题,我们首先对现有模型进行分析,以确认注释如何使SLT变得更容易。我们发现它为模型提供两方面信息:1)可帮助模型隐式学习连续手语视频中语义边界的位置;2)可帮助模型从全局上理解手语视频。随后我们提出“注释注意力”(gloss attention),使模型能像注释帮助现有模型那样,将注意力保持在具有局部相同语义的视频段内。此外,我们将自然语言模型的句对句相似度知识迁移到我们的注释注意力SLT网络(GASLT)中,以助其在句子层面理解手语视频。在多个大规模手语数据集上的实验结果表明,我们提出的GASLT模型显著优于现有方法。我们的代码见 \url{https://github.com/YinAoXiong/GASLT}。

关键词

引用

@article{arxiv.2307.07361,
  title  = {Gloss Attention for Gloss-free Sign Language Translation},
  author = {Aoxiong Yin and Tianyun Zhong and Li Tang and Weike Jin and Tao Jin and Zhou Zhao},
  journal= {arXiv preprint arXiv:2307.07361},
  year   = {2023}
}