失去翻译,却在嵌入中发现:手语翻译与对齐
计算机视觉与模式识别
2025-12-10 v1
摘要
我们的目标是开发一个统一的模型进行手语理解,执行手语翻译(SLT)和手语-字幕对齐(SSA)。这两个任务共同实现将连续手语视频转换为口语文本,以及手语与字幕的时间对齐——这两者都是实际沟通、大规模语料构建和教育应用的必需品。为实现此目标,我们的方法基于三个组件:(i)一个轻量级视觉主干网络,从人类关键点和嘴部区域图像中捕获手动和非手动线索,同时保持签名员隐私;(ii)一个滑动感知器映射网络,将连续视觉特征聚合为词级嵌入,以弥补视觉-文本之间的差距;(iii)一个多任务可扩展训练策略,联合优化 SLT 和 SSA,强化语言和时间对齐。为促进跨语言泛化,我们在覆盖英国手语(BSL)和美国手语(ASL)的大规模手语-文本语料库(BOBSL 和 YouTube-SL-25 数据集)上进行预训练。凭借这种多语言预训练和强大的模型设计,我们在具有挑战性的 BOBSL(BSL)数据集上实现了 SLT 和 SSA 的最先进结果。我们的模型还显示出在 How2Sign(ASL)上的鲁棒零样本泛化和微调后的 SLT 性能,凸显了可扩展翻译在不同手语之间的潜力。
引用
@article{arxiv.2512.08040,
title = {Lost in Translation, Found in Embeddings: Sign Language Translation and Alignment},
author = {Youngjoon Jang and Liliane Momeni and Zifan Jiang and Joon Son Chung and Gül Varol and Andrew Zisserman},
journal= {arXiv preprint arXiv:2512.08040},
year = {2025}
}