SLTUNET:一种用于手语翻译的简洁统一模型
计算与语言
2023-05-04 v1 计算机视觉与模式识别
摘要
尽管神经模型在手语翻译(SLT)中近期取得进展,但由于数据稀缺以及手语视频与文本间的模态鸿沟,翻译质量仍落后于口语。为同时应对两方面问题,我们探究用于 SLT 的跨模态表示共享策略。我们提出 SLTUNET,一种简洁的统一神经模型,旨在联合支持多项 SLT 相关任务,如手语到 gloss、gloss 到文本以及手语到文本翻译。联合建模不同任务赋予 SLTUNET 探索跨任务关联的能力,有助于缩小模态鸿沟。此外,这使我们能利用外部资源的知识,例如用于口语机器翻译(MT)的丰富平行数据。我们在实验中表明,当用 MT 数据增强并配备一组优化技术时,SLTUNET 在 PHOENIX-2014T 与 CSL-Daily 上取得有竞争力甚至最先进的性能。我们进一步首次将 DGS 语料库用于端到端 SLT。其覆盖更广领域且词汇量显著更大,更具挑战性,我们认为其相比前两者可对 SLT 现状进行更现实的评估。即便如此,SLTUNET 在 DGS 语料库上仍取得改进结果。代码见 https://github.com/bzhangGo/sltunet。
引用
@article{arxiv.2305.01778,
title = {SLTUNET: A Simple Unified Model for Sign Language Translation},
author = {Biao Zhang and Mathias Müller and Rico Sennrich},
journal= {arXiv preprint arXiv:2305.01778},
year = {2023}
}
备注
ICLR 2023