中文

Sign2GPT:利用大语言模型进行无词汇注释的手语翻译

计算机视觉与模式识别 2024-05-08 v1

摘要

自动手语翻译需要集成计算机视觉和自然语言处理两者,才能有效弥合手语与口语之间的沟通障碍。然而,由于缺乏大规模训练数据以支持手语翻译,我们需要利用口语语言资源。我们引入了Sign2GPT,一个新的手语翻译框架,该框架利用大规模预训练视觉和语言模型通过轻量级适配器进行无词汇注释的手语翻译。由于数据集有限以及在训练长手势视频时的计算要求,轻量级适配器对于手语翻译至关重要。我们还提出了一种新颖的预训练策略,引导我们的编码器从自动提取的伪词汇注释中学习手势表征,而无需词汇顺序信息或注释。我们在两个公共基准手语翻译数据集上进行评估,即RWTH-PHOENIX-Weather 2014T和CSL-Daily,显著提升了无词汇注释翻译的SOTA性能。

关键词

引用

@article{arxiv.2405.04164,
  title  = {Sign2GPT: Leveraging Large Language Models for Gloss-Free Sign Language Translation},
  author = {Ryan Wong and Necati Cihan Camgoz and Richard Bowden},
  journal= {arXiv preprint arXiv:2405.04164},
  year   = {2024}
}

备注

Accepted at ICLR2024