中文

迈向从语音到手语视频的自动生成

计算机视觉与模式识别 2021-06-25 v1

摘要

我们旨在首次解决仅从语音片段生成连续手语视频这一极具挑战性的任务。该领域近期的研究集中于从人工标注的文本转写生成此类视频,而未考虑其他模态。然而,在与听力受损人群交流时,以手语替代语音被证明是一种实用的解决方案。因此,我们消除了将文本作为输入的需求,并设计了适用于更自然、连续、自由表述且涵盖大量词汇的语音的技术。由于现有数据集不足以直接从语音生成手语,我们收集并发布了首个包含语音级标注、文本转写及相应手语视频的印度手语数据集。接下来,我们提出一个多任务 transformer 网络,经训练从语音片段生成手语者的姿态。以语音转文本作为辅助任务,并引入额外的跨模态判别器,我们的模型以端到端方式学习生成连续手语姿态序列。大量实验及与其他基线的对比证明了我们方法的有效性。我们还进行了额外的消融实验,以分析网络不同模块的影响。补充材料中附有包含若干结果的演示视频。

关键词

引用

@article{arxiv.2106.12790,
  title  = {Towards Automatic Speech to Sign Language Generation},
  author = {Parul Kapoor and Rudrabha Mukhopadhyay and Sindhu B Hegde and Vinay Namboodiri and C V Jawahar},
  journal= {arXiv preprint arXiv:2106.12790},
  year   = {2021}
}

备注

5 pages(including references), 5 figures, Accepted in Interspeech 2021