中文

搭建符号与口语语言之间的桥梁:基于伪 gloss 生成的手语翻译

计算机视觉与模式识别 2025-05-22 v1

摘要

手语翻译(SLT)旨在将手语视频映射到口语语言文本。常见方法依赖 gloss 注释作为中间表示,将 SLT 分解为两个子任务:视频到 gloss 识别和 gloss 到文本翻译。虽然这种方法有效,但其依赖专家标注的 gloss 标签,使得在现有数据集中难以实现规模化。为此,我们提出一种无 gloss 人工生成 gloss 框架,旨在消除对人工标注 gloss 的需求,同时保持结构化的中间表示。具体而言,我们通过基于示例文本-gloss 对的 in-context learning,引导大型语言模型(LLM)从口语文本生成草稿手语 gloss。为增强 LLM 生成的伪 gloss 与视频中手语序列之间的对应关系,我们通过弱监督学习纠正伪 gloss 中的顺序,以实现更好的对齐。这一重排序促进了辅助对齐目标的融入,并允许使用高效的 Connectionist Temporal Classification(CTC)损失进行监督。我们通过三个阶段的训练 pipeline 来训练 SLT 模型,该模型由视觉编码器和翻译器组成,逐步缩小手语与口语之间的模态差距。尽管方法简单,我们的 approach 在两个 SLT 基准测试上优于以往的 SOTA 无 gloss 框架,并与基于 gloss 的方法实现了具竞争力的性能。

关键词

引用

@article{arxiv.2505.15438,
  title  = {Bridging Sign and Spoken Languages: Pseudo Gloss Generation for Sign Language Translation},
  author = {Jianyuan Guo and Peike Li and Trevor Cohn},
  journal= {arXiv preprint arXiv:2505.15438},
  year   = {2025}
}

备注

Technical report, 21 pages