中文

无注释手语翻译:从视觉-语言预训练改进

计算机视觉与模式识别 2023-07-28 v1

摘要

手语翻译(SLT)是一项具有挑战性的任务,因其跨领域性质,涉及将视觉-手势语言翻译为文本。许多先前方法采用中间表示,即注释序列(gloss),以促进 SLT,从而将其转化为手语识别(SLR)随后手语翻译(SLT)的两阶段任务。然而,带注释标注的手语数据稀缺,加上中间层注释表示的信息瓶颈,阻碍了 SLT 任务的进一步发展。为应对这一挑战,我们提出一种基于视觉-语言预训练的无注释手语翻译(GFSLT-VLP),它通过从预训练模型继承面向语言的先验知识来改进 SLT,无需任何注释标注辅助。我们的方法包括两个阶段:(i)将对比语言-图像预训练(CLIP)与掩码自监督学习相结合,创建预任务以弥合视觉与文本表示之间的语义差距并恢复被掩码的句子;(ii)构建具有类编码器-解码器结构的端到端架构,从第一阶段继承预训练视觉编码器与文本解码器的参数。这些新颖设计的无缝结合形成了鲁棒的手语表示,并显著改进了无注释手语翻译。特别地,与最先进的无注释 SLT 方法相比,我们在 PHOENIX14T 数据集(+>5)和 CSL-Daily 数据集(+>3)上实现了前所未有的 BLEU-4 分数提升。此外,与大多数基于注释的方法相比,我们的方法在 PHOENIX14T 数据集上也取得了有竞争力的结果。我们的代码可在 https://github.com/zhoubenjia/GFSLT-VLP 获取。

关键词

引用

@article{arxiv.2307.14768,
  title  = {Gloss-free Sign Language Translation: Improving from Visual-Language Pretraining},
  author = {Benjia Zhou and Zhigang Chen and Albert Clapés and Jun Wan and Yanyan Liang and Sergio Escalera and Zhen Lei and Du Zhang},
  journal= {arXiv preprint arXiv:2307.14768},
  year   = {2023}
}

备注

Accepted to ICCV'23