中文

基于双视觉编码器的无 gloss 对比式预训练用于手语翻译

计算机视觉与模式识别 2025-07-15 v1

摘要

手语翻译(SLT)旨在将手语视频转换为 spoken 或 written 文本。虽然早期系统依赖 gloss 注释作为中间监督,但这些注释昂贵且往往无法捕捉连续手语的完整复杂性。本文提出一种无 gloss SLT 的双视觉编码器框架,利用对比式视觉-语言预训练。在预训练期间,我们的方法使用两个互补视觉 backbone,其输出通过对比目标与句子级文本嵌入联合对齐。在下游 SLT 任务中,我们融合视觉特征并输入编码器-解码器模型。在 Phoenix-2014T 数据集上,我们的双编码器架构持续优于其单流变体,并在现有无 gloss SLT 方法中实现最高的 BLEU-4 分数。

关键词

引用

@article{arxiv.2507.10306,
  title  = {Contrastive Pretraining with Dual Visual Encoders for Gloss-Free Sign Language Translation},
  author = {Ozge Mercanoglu Sincan and Richard Bowden},
  journal= {arXiv preprint arXiv:2507.10306},
  year   = {2025}
}

备注

Accepted at 9th Workshop on Sign Language Translation and Avatar Technologies (SLTAT), will be held in conjunction with IVA'25