利用基于图的跨模态信息融合进行神经手语翻译
计算与语言
2022-11-02 v1 人工智能
摘要
手语(Sign Language, SL)作为聋人群体的母语,是一种大多数听障人士无法理解的特殊视觉语言。近年来,神经手语翻译(SLT)作为弥合聋人与听人之间沟通鸿沟的一种可能途径,引起了广泛的学术关注。我们发现,当前主流的端到端神经SLT模型以弱监督方式学习语言知识,在低数据资源条件下无法挖掘足够的语义信息。因此,我们提出引入手语语言学的额外词级语义知识,以辅助改进当前的端到端神经SLT模型。具体而言,我们提出了一种基于动态图的多模态特征融合新型神经SLT模型,其中跨模态信息(即文本与视频)首先根据其相关性组装为动态图,随后该图由多模态图编码器处理,生成多模态嵌入以供后续神经翻译模型进一步使用。据我们所知,我们首次将图神经网络用于融合多模态信息引入神经手语翻译模型。此外,我们在公开流行的SLT数据集RWTH-PHOENIX-Weather-2014T上进行了实验,定量实验表明我们的方法能够改进模型。
引用
@article{arxiv.2211.00526,
title = {Leveraging Graph-based Cross-modal Information Fusion for Neural Sign Language Translation},
author = {Jiangbin Zheng and Siyuan Li and Cheng Tan and Chong Wu and Yidong Chen and Stan Z. Li},
journal= {arXiv preprint arXiv:2211.00526},
year = {2022}
}