中文

面向端到端手语翻译的跨模态数据增强

计算与语言 2024-06-05 v4

摘要

端到端手语翻译(SLT)旨在直接将手语视频转换为口语文本,无需中间表示。由于手语视频与文本之间的模态差异以及标注数据稀缺,该任务一直具有挑战性。受这些挑战影响,端到端手语翻译(即视频到文本)的输入与输出分布相比词元到文本(gloss-to-text,即文本到文本)方法效果较差。为应对这些挑战,我们提出一种新颖的跨模态数据增强(XmDA)框架,通过利用手语词元翻译模型生成的伪词元-文本对,将强大的词元到文本翻译能力迁移至端到端手语翻译(即视频到文本)。具体而言,XmDA由两个关键组件构成,即跨模态混合(cross-modality mix-up)与跨模态知识蒸馏(cross-modality knowledge distillation)。前者显式地鼓励手语视频特征与词元嵌入之间的对齐,以弥合模态差异;后者利用来自词元到文本教师模型的生成知识来引导口语文本的生成。在PHOENIX-2014T和CSL-Daily两个广泛使用的SLT数据集上的实验结果表明,所提出的XmDA框架显著且持续地优于基线模型。大量分析证实了我们的论断:XmDA通过减小视频与文本之间的表示距离,并改善对低频词和长句子的处理,从而增强了口语文本的生成。

关键词

引用

@article{arxiv.2305.11096,
  title  = {Cross-modality Data Augmentation for End-to-End Sign Language Translation},
  author = {Jinhui Ye and Wenxiang Jiao and Xing Wang and Zhaopeng Tu and Hui Xiong},
  journal= {arXiv preprint arXiv:2305.11096},
  year   = {2024}
}

备注

Update according to the feedback from the EMNLP 2023 poster