中文

基于潜在运动Transformer的手语生成

计算机视觉与模式识别 2023-12-21 v1 人工智能

摘要

手语生成(SLP)是将手语转化为手语视频的艰巨任务。SLP的主要目标是使用手语词汇创建这些视频。在这项研究中,我们开发了一种新方法,无需使用人体姿态作为中间步骤即可生成高质量的手语视频。我们的模型由两个主要部分组成:首先,它从生成器和视频的隐藏特征中学习;其次,它使用另一个模型来理解这些隐藏特征的顺序。为了使该方法更适用于手语视频,我们进行了几项重要改进。(i) 在第一阶段,我们采用改进的3D VQ-GAN来学习下采样的潜在表示。(ii) 在第二阶段,我们引入序列到序列注意力以更好地利用条件信息。(iii) 分离的两阶段训练丢弃了第二阶段中潜在码的现实视觉语义。为了赋予潜在序列语义信息,我们将基于感知损失和重建损失的令牌级自回归潜在码学习扩展到具有视觉感知的先验模型。与之前最先进的方法相比,我们的模型在两个词级手语数据集(即WLASL和NMFs-CSL)上表现一致更好。

关键词

引用

@article{arxiv.2312.12917,
  title  = {Sign Language Production with Latent Motion Transformer},
  author = {Pan Xie and Taiyi Peng and Yao Du and Qipeng Zhang},
  journal= {arXiv preprint arXiv:2312.12917},
  year   = {2023}
}

备注

Accepted by WACV2024