VK-G2T:视觉与上下文知识增强的Gloss2Text
计算与语言
2023-12-19 v1
摘要
现有的手语翻译方法遵循两阶段流水线:首先将手语视频转换为手语标注序列(即Sign2Gloss),然后将生成的手语标注序列翻译成口语语句(即Gloss2Text)。虽然以往的研究侧重于提升Sign2Gloss阶段的性能,但我们强调对Gloss2Text阶段的优化。然而,由于Gloss2Text的两个独特特征,这项任务并非易事:(1)孤立的手语标注输入和(2)低容量手语标注词汇。为了解决这些问题,我们提出了一种视觉与上下文知识增强的Gloss2Text模型,命名为VK-G2T,该模型利用手语视频的视觉内容来学习目标句子的属性,并利用上下文知识促进手语标注词的适应性翻译。在中文基准上进行的广泛实验验证了我们模型的优越性。
引用
@article{arxiv.2312.10210,
title = {VK-G2T: Vision and Context Knowledge enhanced Gloss2Text},
author = {Liqiang Jing and Xuemeng Song and Xinxing Zu and Na Zheng and Zhongzhou Zhao and Liqiang Nie},
journal= {arXiv preprint arXiv:2312.10210},
year = {2023}
}
备注
Accepted by ICASSP 2024