迷失于翻译,寻回于上下文:利用上下文线索的手语翻译
计算机视觉与模式识别
2025-04-01 v2
摘要
我们的目标是将连续手语翻译为口语文本。受人类译员依赖上下文进行准确翻译的启发,我们将额外的上下文线索与手语视频一起纳入一个新的翻译框架。具体而言,除了对输入视频进行编码的视觉手语识别特征外,我们还整合了来自以下方面的互补文本信息:描述背景节目的字幕、前序句子的翻译,以及转录手语的伪注释。这些信息被自动提取,并与视觉特征一起输入到预训练的大型语言模型(LLM)中,我们对该模型进行微调以生成文本形式的口语翻译。通过广泛的消融研究,我们展示了每种输入线索对翻译性能的积极贡献。我们在目前可用的最大英国手语数据集 BOBSL 上训练并评估了我们的方法。结果表明,与先前在 BOBSL 上报告的结果以及我们作为基线实现的最先进方法相比,我们的上下文方法显著提升了翻译质量。此外,我们将该方法应用于美国手语数据集 How2Sign,展示了其通用性并取得了具有竞争力的结果。
引用
@article{arxiv.2501.09754,
title = {Lost in Translation, Found in Context: Sign Language Translation with Contextual Cues},
author = {Youngjoon Jang and Haran Raajesh and Liliane Momeni and Gül Varol and Andrew Zisserman},
journal= {arXiv preprint arXiv:2501.09754},
year = {2025}
}
备注
CVPR 2025 Camera Ready, Project page: https://www.robots.ox.ac.uk/~vgg/research/litfic/