中文

联合利用先验结构与时间一致性进行手语视频生成

计算机视觉与模式识别 2022-07-11 v1

摘要

手语是残障人士表达其感受与情感的一个窗口。然而,人们要在短时间内学习手语仍然具有挑战性。为解决这一现实挑战,在本工作中,我们研究运动迁移系统,其可将用户照片迁移为特定词语的手语视频。具体而言,输出视频的外观内容来自所提供的用户图像,而视频的运动则从指定的教学视频中提取。我们观察到将最先进的运动迁移方法用于手语生成时有两处主要局限:(1) 现有的运动迁移工作忽略了人体的先验几何知识。(2) 先前的图像动画方法在训练阶段仅以图像对作为输入,无法充分利用视频内的时间信息。为尝试解决上述局限,我们提出结构感知时间一致性网络(STCNet),以联合优化人体的先验结构与时间一致性来进行手语视频生成。本文有两点主要贡献。(1) 我们利用细粒度骨架检测器提供身体关键点的先验知识。以此方式,我们确保关键点运动处于有效范围内,并使模型更具可解释性与鲁棒性。(2) 我们引入两种循环一致性损失,即短期循环损失与长期循环损失,用以保证生成视频的连续性。我们以端到端方式优化这两种损失与关键点检测网络。

关键词

引用

@article{arxiv.2207.03714,
  title  = {Jointly Harnessing Prior Structures and Temporal Consistency for Sign Language Video Generation},
  author = {Yucheng Suo and Zhedong Zheng and Xiaohan Wang and Bang Zhang and Yi Yang},
  journal= {arXiv preprint arXiv:2207.03714},
  year   = {2022}
}