中文

VK-G2T:视觉与上下文知识增强的Gloss2Text

计算与语言 2023-12-19 v1

摘要

现有的手语翻译方法遵循两阶段流水线:首先将手语视频转换为手语标注序列(即Sign2Gloss),然后将生成的手语标注序列翻译成口语语句(即Gloss2Text)。虽然以往的研究侧重于提升Sign2Gloss阶段的性能,但我们强调对Gloss2Text阶段的优化。然而,由于Gloss2Text的两个独特特征,这项任务并非易事:(1)孤立的手语标注输入和(2)低容量手语标注词汇。为了解决这些问题,我们提出了一种视觉与上下文知识增强的Gloss2Text模型,命名为VK-G2T,该模型利用手语视频的视觉内容来学习目标句子的属性,并利用上下文知识促进手语标注词的适应性翻译。在中文基准上进行的广泛实验验证了我们模型的优越性。

关键词

引用

@article{arxiv.2312.10210,
  title  = {VK-G2T: Vision and Context Knowledge enhanced Gloss2Text},
  author = {Liqiang Jing and Xuemeng Song and Xinxing Zu and Na Zheng and Zhongzhou Zhao and Liqiang Nie},
  journal= {arXiv preprint arXiv:2312.10210},
  year   = {2023}
}

备注

Accepted by ICASSP 2024