中文

神经手语演员:一种基于文本生成3D手语的扩散模型

计算机视觉与模式识别 2024-04-08 v2

摘要

手语(Sign Languages, SL)是聋人和听障社区的主要交流方式。用于手语识别和翻译的深度学习方法已取得了可喜的成果。然而,手语生成(Sign Language Production, SLP)面临挑战,因为生成的动作必须逼真且具有精确的语义。大多数SLP方法依赖2D数据,这阻碍了其真实感。在这项工作中,我们基于一个精心构建的大规模4D手语化身及其对应文本转录数据集,训练了一个基于扩散的SLP模型。所提出的方法能够利用在SMPL-X身体骨架上定义的、新颖且符合解剖学信息的图神经网络上形成的扩散过程,从无约束的话语域生成3D化身的动态序列。通过定量和定性实验,我们表明所提出的方法显著优于以往的SLP方法。这项工作朝着逼真的神经手语化身迈出了重要一步,弥合了聋人和听人社区之间的沟通鸿沟。

关键词

引用

@article{arxiv.2312.02702,
  title  = {Neural Sign Actors: A diffusion model for 3D sign language production from text},
  author = {Vasileios Baltatzis and Rolandos Alexandros Potamias and Evangelos Ververas and Guanxiong Sun and Jiankang Deng and Stefanos Zafeiriou},
  journal= {arXiv preprint arXiv:2312.02702},
  year   = {2024}
}

备注

Accepted at CVPR 2024, Project page: https://baltatzisv.github.io/neural-sign-actors/