神经手语演员:一种基于文本生成3D手语的扩散模型
计算机视觉与模式识别
2024-04-08 v2
摘要
手语(Sign Languages, SL)是聋人和听障社区的主要交流方式。用于手语识别和翻译的深度学习方法已取得了可喜的成果。然而,手语生成(Sign Language Production, SLP)面临挑战,因为生成的动作必须逼真且具有精确的语义。大多数SLP方法依赖2D数据,这阻碍了其真实感。在这项工作中,我们基于一个精心构建的大规模4D手语化身及其对应文本转录数据集,训练了一个基于扩散的SLP模型。所提出的方法能够利用在SMPL-X身体骨架上定义的、新颖且符合解剖学信息的图神经网络上形成的扩散过程,从无约束的话语域生成3D化身的动态序列。通过定量和定性实验,我们表明所提出的方法显著优于以往的SLP方法。这项工作朝着逼真的神经手语化身迈出了重要一步,弥合了聋人和听人社区之间的沟通鸿沟。
引用
@article{arxiv.2312.02702,
title = {Neural Sign Actors: A diffusion model for 3D sign language production from text},
author = {Vasileios Baltatzis and Rolandos Alexandros Potamias and Evangelos Ververas and Guanxiong Sun and Jiankang Deng and Stefanos Zafeiriou},
journal= {arXiv preprint arXiv:2312.02702},
year = {2024}
}
备注
Accepted at CVPR 2024, Project page: https://baltatzisv.github.io/neural-sign-actors/