中文

SignNet:基于度量嵌入学习的单通道手语生成

人机交互 2022-12-07 v1 人工智能

摘要

一个真正的手语翻译智能体不仅要理解手语并翻译为文本,还要理解文本并翻译为手语。迄今为止,手语翻译方面的大部分人工智能工作主要集中在从手语到文本的翻译。针对后一目标,我们提出了一种文本到手语的翻译模型 SignNet,它在翻译中利用了视觉手语的相似性(与不相似性)概念。所提出的模块仅是涉及文本到手语(T2S)以及手语到文本(S2T)的双学习双任务过程的一部分。我们目前将 SignNet 实现为单通道架构,以便 T2S 任务的输出可输入 S2T,形成连续的双学习框架。所谓单通道,我们指的是单一模态,即身体姿态关节。在这项工作中,我们提出 SignNet,一种使用新颖度量嵌入学习过程的 T2S 任务,以保留手语嵌入之间相对于其不相似性的距离。我们还描述了如何为相似性测试选择手语的正例和负例。根据我们的分析,在使用 BLEU 分数评估时,基于度量嵌入学习的模型表现显著优于采用传统损失的其它模型。在词素到姿态的任务中,SignNet 表现与其最先进的(SoTA)同类方法相当,并在文本到姿态的任务中超越它们,在流行的 RWTH PHOENIX-Weather-2014T 基准数据集上测试时,BLEU 1 至 BLEU 4 分数显示出显著提升(BLEU 1:31→39,约 26% 提升;BLEU 4:10.43→11.84,约 14% 提升)。

关键词

引用

@article{arxiv.2212.02848,
  title  = {SignNet: Single Channel Sign Generation using Metric Embedded Learning},
  author = {Tejaswini Ananthanarayana and Lipisha Chaudhary and Ifeoma Nwogu},
  journal= {arXiv preprint arXiv:2212.02848},
  year   = {2022}
}

备注

9 pages, 4 figures, 4 tables - IEEE Face and Gestures, 2023