基于双视觉编码器的无 gloss 对比式预训练用于手语翻译
计算机视觉与模式识别
2025-07-15 v1
摘要
手语翻译(SLT)旨在将手语视频转换为 spoken 或 written 文本。虽然早期系统依赖 gloss 注释作为中间监督,但这些注释昂贵且往往无法捕捉连续手语的完整复杂性。本文提出一种无 gloss SLT 的双视觉编码器框架,利用对比式视觉-语言预训练。在预训练期间,我们的方法使用两个互补视觉 backbone,其输出通过对比目标与句子级文本嵌入联合对齐。在下游 SLT 任务中,我们融合视觉特征并输入编码器-解码器模型。在 Phoenix-2014T 数据集上,我们的双编码器架构持续优于其单流变体,并在现有无 gloss SLT 方法中实现最高的 BLEU-4 分数。
引用
@article{arxiv.2507.10306,
title = {Contrastive Pretraining with Dual Visual Encoders for Gloss-Free Sign Language Translation},
author = {Ozge Mercanoglu Sincan and Richard Bowden},
journal= {arXiv preprint arXiv:2507.10306},
year = {2025}
}
备注
Accepted at 9th Workshop on Sign Language Translation and Avatar Technologies (SLTAT), will be held in conjunction with IVA'25